Skip to content

不建议 Docker 运行,目前 BUG 比较多,更新比较快,Docker 镜像更新并不及时

使用 uv 创建一个名称为 vllm 的虚拟环境

bash
uv venv vllm --python 3.12 --seed

激活虚拟环境:

bash
source vllm/bin/activate

安装依赖包:

bash
uv pip install flashinfer-python -i https://flashinfer.ai/whl/cu124/torch2.5/

启动

使用如下命令启动模型服务:

bash
vllm serve /home/Model/Qwen2.5-32B-Instruct-abliterated-pass2-AWQ \
        --tensor-parallel-size 2 \
        --block-size 32 \
        --max-num-seqs 64 \
        --max-model-len 8192 \
        --max-num-batched-tokens 8192 \
        --port 8102 \
        --served-model-name Qwen2.5-32B-Instruct-abliterated-pass2-AWQ \
        --gpu-memory-utilization 0.8 \
        --enforce-eager \
        --dtype float16

后台运行并输出日志到文件:

bash
nohup  vllm serve /home/Model/Qwen2.5-32B-Instruct-abliterated-pass2-AWQ --tensor-parallel-size 2 --block-size 32 --max-num-seqs 64 --max-model-len 8192 --max-num-batched-tokens 8192 --port 8102 --served-model-name Qwen2.5-32B --gpu-memory-utilization 0.85 --enforce-eager --dtype float16 --api-key 13232094481 > /home/vllm.log 2>&1 & tail -f /home/vllm.log

Docker 启动(不推荐)

使用 Docker 启动 vLLM 服务(注意:目前不推荐使用 Docker):

bash
docker run -itd --runtime nvidia  \
  --gpus all \
  --ipc=host \
  --restart unless-stopped \
  --name qwen32b-container \
  -p 8102:8000 \
  -v /home/Model/:/model \
  -e API_KEY=13232094481 \
  vllm/vllm-openai:latest \
  --model /model/Qwen2.5-32B-Instruct-abliterated-pass2-AWQ \
  --served-model-name Qwen2.5-32B \
  --tensor-parallel-size 2 \
  --block-size 32 \
  --max-num-seqs 64 \
  --max-model-len 8192 \
  --max-num-batched-tokens 8192 \
  --gpu-memory-utilization 0.8 \
  --enforce-eager \
  --dtype float16