Vllm:修订间差异
来自Ac-Wiki
更多操作
小无编辑摘要 |
小无编辑摘要 |
||
| 第2行: | 第2行: | ||
企业级的[[开源]]的大模型推理框架,与作为个人级的 [[llama.cpp]] 相对。 | 企业级的[[开源]]的大模型推理框架,与作为个人级的 [[llama.cpp]] 相对。 | ||
vLLM 是一个[[开源]]的[[大语言模型]]推理加速框架,由[[加州大学伯克利分校]]研究团队开发。其核心创新在于 PagedAttention 算法,通过将注意力键值对分页管理,显著降低显存碎片并提升推理吞吐量。vLLM 支持包括 [[LLaMA]]、[[Mistral]]、[[Qwen]] 在内的多种主流模型,并提供兼容 [[OpenAI]] [[API]] 的接口,适合用于模型部署与大规模在线推理服务。项目于 2023 年发布后迅速获得广泛采用。 | |||
{{DISPLAYTITLE:vLLM}} | {{DISPLAYTITLE:vLLM}} | ||