vLLM 大模型部署实战:OpenAI 兼容 API、GPU 容量与性能调优
从 GPU 与驱动预检、模型缓存、Docker 启动、兼容 API 验证,到 KV Cache、并发、量化和压测,给出可回滚的...
TY
2026-09-23 · 24 分钟
覆盖大模型部署、推理调优、RAG 知识库、模型微调、AI Coding、智能体与生产治理的实战文章。
从 GPU 与驱动预检、模型缓存、Docker 启动、兼容 API 验证,到 KV Cache、并发、量化和压测,给出可回滚的...
用可验证的工程决策树串联模型选型、基线评测、RAG、LoRA 微调、Agent 与生产治理,帮助初学者先完成闭环,...