不建议 Docker 运行,目前 BUG 比较多,更新比较快,Docker 镜像更新并不及时
使用 uv 创建一个名称为 vllm 的虚拟环境
bash
uv venv vllm --python 3.12 --seed激活虚拟环境:
bash
source vllm/bin/activate安装依赖包:
bash
uv pip install flashinfer-python -i https://flashinfer.ai/whl/cu124/torch2.5/启动
使用如下命令启动模型服务:
bash
vllm serve /home/Model/Qwen2.5-32B-Instruct-abliterated-pass2-AWQ \
--tensor-parallel-size 2 \
--block-size 32 \
--max-num-seqs 64 \
--max-model-len 8192 \
--max-num-batched-tokens 8192 \
--port 8102 \
--served-model-name Qwen2.5-32B-Instruct-abliterated-pass2-AWQ \
--gpu-memory-utilization 0.8 \
--enforce-eager \
--dtype float16后台运行并输出日志到文件:
bash
nohup vllm serve /home/Model/Qwen2.5-32B-Instruct-abliterated-pass2-AWQ --tensor-parallel-size 2 --block-size 32 --max-num-seqs 64 --max-model-len 8192 --max-num-batched-tokens 8192 --port 8102 --served-model-name Qwen2.5-32B --gpu-memory-utilization 0.85 --enforce-eager --dtype float16 --api-key 13232094481 > /home/vllm.log 2>&1 & tail -f /home/vllm.logDocker 启动(不推荐)
使用 Docker 启动 vLLM 服务(注意:目前不推荐使用 Docker):
bash
docker run -itd --runtime nvidia \
--gpus all \
--ipc=host \
--restart unless-stopped \
--name qwen32b-container \
-p 8102:8000 \
-v /home/Model/:/model \
-e API_KEY=13232094481 \
vllm/vllm-openai:latest \
--model /model/Qwen2.5-32B-Instruct-abliterated-pass2-AWQ \
--served-model-name Qwen2.5-32B \
--tensor-parallel-size 2 \
--block-size 32 \
--max-num-seqs 64 \
--max-model-len 8192 \
--max-num-batched-tokens 8192 \
--gpu-memory-utilization 0.8 \
--enforce-eager \
--dtype float16