无法加载偏好设置。请检查您的网络连接并重试。
网站测试中,如需帮助或提出建议请联系维护员 @天明
https://vllm.ai/
企业级的开源的大模型推理框架,与作为个人级的 llama.cpp 相对。
vLLM 是一个开源的大语言模型推理加速框架,由加州大学伯克利分校研究团队开发。其核心创新在于 PagedAttention 算法,通过将注意力键值对分页管理,显著降低显存碎片并提升推理吞吐量。vLLM 支持包括 LLaMA、Mistral、Qwen 在内的多种主流模型,并提供兼容 OpenAI API 的接口,适合用于模型部署与大规模在线推理服务。项目于 2023 年发布后迅速获得广泛采用。