Files

52 lines
1.4 KiB
Bash
Executable File

#!/bin/bash
# start-server.sh - 启动 llama.cpp 推理服务 (Intel Mac 8GB 内存优化)
MODEL_DIR="${HOME}/.llama/models"
MODEL_NAME="qwen3-1.8b-q4_k_m.gguf"
MODEL_PATH="$MODEL_DIR/$MODEL_NAME"
# 检查模型是否存在
if [ ! -f "$MODEL_PATH" ]; then
echo "❌ 模型未找到: $MODEL_PATH"
echo "请先运行: ./download-model.sh"
exit 1
fi
echo "=== 启动 llama.cpp 推理服务 ==="
echo "模型: $MODEL_NAME"
echo "内存优化: 针对 Intel Mac 8GB 优化"
echo ""
# Intel CPU + 8GB 内存优化参数
# -t 4: 使用4线程 (你的CPU是4核8线程,留一些给系统)
# -c 4096: 上下文长度 4K (省内存)
# -np 1: 单并发 (避免内存爆炸)
# --mlock: 锁定内存防止 swap (可选,如果你的内存够)
# --host 0.0.0.0: 允许局域网访问 (可选)
llama-server \
--model "$MODEL_PATH" \
--threads 4 \
--ctx-size 4096 \
--parallel 1 \
--batch-size 512 \
--timeout 300 \
--host 127.0.0.1 \
--port 8080 \
--api-key "local-llm-key" \
--verbose \
"$@"
# 如果 llama-server 找不到,尝试 llama-cli
if [ $? -ne 0 ]; then
echo ""
echo "⚠️ llama-server 未找到,尝试 llama-cli 交互模式..."
echo "(注意: llama-cli 不提供 API 服务,仅用于测试)"
llama-cli \
--model "$MODEL_PATH" \
--threads 4 \
--ctx-size 4096 \
--interactive \
--verbose-prompt
fi