Llama.cpp:修订间差异
来自Ac-Wiki
更多操作
创建页面,内容为“llama.cpp 是一个开源的 C/C++ 项目,旨在在本地硬件上高效运行大语言模型,最初针对 Meta 的 LLaMA 模型设计。主要用途是让用户无需依赖云服务即可在 CPU 或普通 GPU 上推理运行模型。核心特点包括使用 GGUF 格式量化模型以降低内存占用,支持多平台(Windows、Linux、macOS、Android)及多种加速后端(如 BLAS、CUDA、Vulkan)。项目于 2023 年 3 月由开发者 Georgi Ger…” |
小无编辑摘要 |
||
| 第1行: | 第1行: | ||
llama.cpp | https://llama.app/ | ||
https://github.com/ggml-org/llama.cpp | |||
llama.cpp 是一个[[开源]]的 [[C 语言|C]]/[[C++]] 项目,旨在在本地硬件上高效运行[[大语言模型]],最初针对 [[Meta]] 的 [[LLaMA|LLaMA 模型]]设计。主要用途是让用户无需依赖云服务即可在 [[CPU]] 或普通 [[GPU]] 上推理运行模型。核心特点包括使用 [[GGUF|GGUF 格式]]量化模型以降低内存占用,支持多平台([[Windows]]、[[Linux]]、[[macOS]]、[[Android]])及多种加速后端(如 BLAS、[[CUDA]]、[[Vulkan]])。项目于 2023 年 3 月由开发者 Georgi Gerganov 首次发布,后续社区贡献使其支持更多模型架构,成为本地运行开源大模型的重要工具之一。 | |||
{{DISPLAYTITLE: llama.cpp}} | |||
2026年6月14日 (日) 23:26的最新版本
https://github.com/ggml-org/llama.cpp
llama.cpp 是一个开源的 C/C++ 项目,旨在在本地硬件上高效运行大语言模型,最初针对 Meta 的 LLaMA 模型设计。主要用途是让用户无需依赖云服务即可在 CPU 或普通 GPU 上推理运行模型。核心特点包括使用 GGUF 格式量化模型以降低内存占用,支持多平台(Windows、Linux、macOS、Android)及多种加速后端(如 BLAS、CUDA、Vulkan)。项目于 2023 年 3 月由开发者 Georgi Gerganov 首次发布,后续社区贡献使其支持更多模型架构,成为本地运行开源大模型的重要工具之一。