打开/关闭菜单
打开/关闭外观设置菜单
打开/关闭个人菜单
未登录
未登录用户的IP地址会在进行任意编辑后公开展示。

网站测试中,如需帮助或提出建议
联系维护员 @天明

Llama.cpp:修订间差异

来自Ac-Wiki
天明留言 | 贡献
创建页面,内容为“llama.cpp 是一个开源的 C/C++ 项目,旨在在本地硬件上高效运行大语言模型,最初针对 Meta 的 LLaMA 模型设计。主要用途是让用户无需依赖云服务即可在 CPU 或普通 GPU 上推理运行模型。核心特点包括使用 GGUF 格式量化模型以降低内存占用,支持多平台(Windows、Linux、macOS、Android)及多种加速后端(如 BLAS、CUDA、Vulkan)。项目于 2023 年 3 月由开发者 Georgi Ger…”
 
天明留言 | 贡献
无编辑摘要
 
第1行: 第1行:
llama.cpp 是一个开源的 C/C++ 项目,旨在在本地硬件上高效运行大语言模型,最初针对 Meta 的 LLaMA 模型设计。主要用途是让用户无需依赖云服务即可在 CPU 或普通 GPU 上推理运行模型。核心特点包括使用 GGUF 格式量化模型以降低内存占用,支持多平台(Windows、Linux、macOS、Android)及多种加速后端(如 BLAS、CUDA、Vulkan)。项目于 2023 年 3 月由开发者 Georgi Gerganov 首次发布,后续社区贡献使其支持更多模型架构,成为本地运行开源大模型的重要工具之一。
https://llama.app/
 
https://github.com/ggml-org/llama.cpp
 
llama.cpp 是一个[[开源]]的 [[C 语言|C]]/[[C++]] 项目,旨在在本地硬件上高效运行[[大语言模型]],最初针对 [[Meta]] [[LLaMA|LLaMA 模型]]设计。主要用途是让用户无需依赖云服务即可在 [[CPU]] 或普通 [[GPU]] 上推理运行模型。核心特点包括使用 [[GGUF|GGUF 格式]]量化模型以降低内存占用,支持多平台([[Windows]]、[[Linux]]、[[macOS]]、[[Android]])及多种加速后端(如 BLAS、[[CUDA]]、[[Vulkan]])。项目于 2023 年 3 月由开发者 Georgi Gerganov 首次发布,后续社区贡献使其支持更多模型架构,成为本地运行开源大模型的重要工具之一。
 
{{DISPLAYTITLE: llama.cpp}}

2026年6月14日 (日) 23:26的最新版本

https://llama.app/

https://github.com/ggml-org/llama.cpp

llama.cpp 是一个开源C/C++ 项目,旨在在本地硬件上高效运行大语言模型,最初针对 MetaLLaMA 模型设计。主要用途是让用户无需依赖云服务即可在 CPU 或普通 GPU 上推理运行模型。核心特点包括使用 GGUF 格式量化模型以降低内存占用,支持多平台(WindowsLinuxmacOSAndroid)及多种加速后端(如 BLAS、CUDAVulkan)。项目于 2023 年 3 月由开发者 Georgi Gerganov 首次发布,后续社区贡献使其支持更多模型架构,成为本地运行开源大模型的重要工具之一。