打开/关闭菜单
打开/关闭外观设置菜单
打开/关闭个人菜单
未登录
未登录用户的IP地址会在进行任意编辑后公开展示。

网站测试中,如需帮助或提出建议
联系维护员 @天明

天明留言 | 贡献
创建页面,内容为“vLLM https://vllm.ai/ 企业级的开源的大模型推理框架,与作为个人级的 llama.cpp 相对。”
 
天明留言 | 贡献
无编辑摘要
 
(未显示同一用户的1个中间版本)
第1行: 第1行:
vLLM
https://vllm.ai/
https://vllm.ai/


企业级的[[开源]]的大模型推理框架,与作为个人级的 [[llama.cpp]] 相对。
企业级的[[开源]]的大模型推理框架,与作为个人级的 [[llama.cpp]] 相对。
vLLM 是一个[[开源]]的[[大语言模型]]推理加速框架,由[[加州大学伯克利分校]]研究团队开发。其核心创新在于 PagedAttention 算法,通过将注意力键值对分页管理,显著降低显存碎片并提升推理吞吐量。vLLM 支持包括 [[LLaMA]]、[[Mistral]]、[[Qwen]] 在内的多种主流模型,并提供兼容 [[OpenAI]] [[API]] 的接口,适合用于模型部署与大规模在线推理服务。项目于 2023 年发布后迅速获得广泛采用。
{{DISPLAYTITLE:vLLM}}

2026年6月14日 (日) 23:23的最新版本

https://vllm.ai/

企业级的开源的大模型推理框架,与作为个人级的 llama.cpp 相对。

vLLM 是一个开源大语言模型推理加速框架,由加州大学伯克利分校研究团队开发。其核心创新在于 PagedAttention 算法,通过将注意力键值对分页管理,显著降低显存碎片并提升推理吞吐量。vLLM 支持包括 LLaMAMistralQwen 在内的多种主流模型,并提供兼容 OpenAI API 的接口,适合用于模型部署与大规模在线推理服务。项目于 2023 年发布后迅速获得广泛采用。