Llama.cpp
来自Ac-Wiki
更多操作
llama.cpp 是一个开源的 C/C++ 项目,旨在在本地硬件上高效运行大语言模型,最初针对 Meta 的 LLaMA 模型设计。主要用途是让用户无需依赖云服务即可在 CPU 或普通 GPU 上推理运行模型。核心特点包括使用 GGUF 格式量化模型以降低内存占用,支持多平台(Windows、Linux、macOS、Android)及多种加速后端(如 BLAS、CUDA、Vulkan)。项目于 2023 年 3 月由开发者 Georgi Gerganov 首次发布,后续社区贡献使其支持更多模型架构,成为本地运行开源大模型的重要工具之一。