llama.cpp
用 C/C++ 实现 LLM 推理,以最简设置和一流性能在本地和云端的各种硬件上运行。
访问 ggml-org/llama.cpp项目简介
llama.cpp 支持 LLM 和 VLM 推理,以最简设置和一流性能在本地和云端的各种硬件上运行。它基于 ggml 库构建。
核心功能
- 纯 C/C++ 实现,无任何依赖
- 针对 Apple 芯片优化,使用 ARM NEON、Accelerate 和 Metal 框架
- 支持 1.5 位到 8 位的整数量化,加快推理并减少内存使用
- 为 NVIDIA GPU 提供自定义 CUDA 内核,通过 HIP 支持 AMD,通过 MUSA 支持摩尔线程
- 支持 Vulkan 和 SYCL 后端
- 支持 CPU+GPU 混合推理,以处理大于显存容量的模型
适用场景
- 从 Hugging Face 本地运行 LLM 和 VLM 模型
- 启动兼容 OpenAI 的 API 服务器
- 使用内置 Web UI 进行交互式会话
- 通过 CPU+GPU 混合推理加速大型模型
快速开始
- 访问 https://llama\.app 并按照说明操作
- 使用 Docker 运行(参见 Docker 文档)
- 从发布页面下载预构建二进制文件
- 通过克隆仓库从源码构建(参见构建指南)
- 示例:llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
部署与要求
- 支持多种硬件后端,包括 CPU、NVIDIA GPU(CUDA)、AMD GPU(HIP)、Apple Silicon(Metal)、Intel GPU(SYCL)、Vulkan、WebGPU 等
- 核心实现无外部依赖
- 可通过 Docker 或预构建二进制文件部署
采用前须知
- 许可证:MIT。在使用、修改或分发项目前,请确认其具体条款。