52 lines
1.4 KiB
Bash
Executable File
52 lines
1.4 KiB
Bash
Executable File
#!/bin/bash
|
|
# start-server.sh - 启动 llama.cpp 推理服务 (Intel Mac 8GB 内存优化)
|
|
|
|
MODEL_DIR="${HOME}/.llama/models"
|
|
MODEL_NAME="qwen3-1.8b-q4_k_m.gguf"
|
|
MODEL_PATH="$MODEL_DIR/$MODEL_NAME"
|
|
|
|
# 检查模型是否存在
|
|
if [ ! -f "$MODEL_PATH" ]; then
|
|
echo "❌ 模型未找到: $MODEL_PATH"
|
|
echo "请先运行: ./download-model.sh"
|
|
exit 1
|
|
fi
|
|
|
|
echo "=== 启动 llama.cpp 推理服务 ==="
|
|
echo "模型: $MODEL_NAME"
|
|
echo "内存优化: 针对 Intel Mac 8GB 优化"
|
|
echo ""
|
|
|
|
# Intel CPU + 8GB 内存优化参数
|
|
# -t 4: 使用4线程 (你的CPU是4核8线程,留一些给系统)
|
|
# -c 4096: 上下文长度 4K (省内存)
|
|
# -np 1: 单并发 (避免内存爆炸)
|
|
# --mlock: 锁定内存防止 swap (可选,如果你的内存够)
|
|
# --host 0.0.0.0: 允许局域网访问 (可选)
|
|
|
|
llama-server \
|
|
--model "$MODEL_PATH" \
|
|
--threads 4 \
|
|
--ctx-size 4096 \
|
|
--parallel 1 \
|
|
--batch-size 512 \
|
|
--timeout 300 \
|
|
--host 127.0.0.1 \
|
|
--port 8080 \
|
|
--api-key "local-llm-key" \
|
|
--verbose \
|
|
"$@"
|
|
|
|
# 如果 llama-server 找不到,尝试 llama-cli
|
|
if [ $? -ne 0 ]; then
|
|
echo ""
|
|
echo "⚠️ llama-server 未找到,尝试 llama-cli 交互模式..."
|
|
echo "(注意: llama-cli 不提供 API 服务,仅用于测试)"
|
|
llama-cli \
|
|
--model "$MODEL_PATH" \
|
|
--threads 4 \
|
|
--ctx-size 4096 \
|
|
--interactive \
|
|
--verbose-prompt
|
|
fi
|