跳过主要内容
广告OpenFree logo推广你的产品触达更多潜在用户,助力产品增长与收益提升。投放广告
Favicon of llama.cpp

llama.cpp

Free 等级项目

用 C/C++ 实现 LLM 推理,以最简设置和一流性能在本地和云端的各种硬件上运行。

访问 ggml-org/llama.cpp

项目简介

llama.cpp 支持 LLM 和 VLM 推理,以最简设置和一流性能在本地和云端的各种硬件上运行。它基于 ggml 库构建。

核心功能

  • 纯 C/C++ 实现,无任何依赖
  • 针对 Apple 芯片优化,使用 ARM NEON、Accelerate 和 Metal 框架
  • 支持 1.5 位到 8 位的整数量化,加快推理并减少内存使用
  • 为 NVIDIA GPU 提供自定义 CUDA 内核,通过 HIP 支持 AMD,通过 MUSA 支持摩尔线程
  • 支持 Vulkan 和 SYCL 后端
  • 支持 CPU+GPU 混合推理,以处理大于显存容量的模型

适用场景

  • 从 Hugging Face 本地运行 LLM 和 VLM 模型
  • 启动兼容 OpenAI 的 API 服务器
  • 使用内置 Web UI 进行交互式会话
  • 通过 CPU+GPU 混合推理加速大型模型

快速开始

  • 访问 https://llama\.app 并按照说明操作
  • 使用 Docker 运行(参见 Docker 文档)
  • 从发布页面下载预构建二进制文件
  • 通过克隆仓库从源码构建(参见构建指南)
  • 示例:llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF

部署与要求

  • 支持多种硬件后端,包括 CPU、NVIDIA GPU(CUDA)、AMD GPU(HIP)、Apple Silicon(Metal)、Intel GPU(SYCL)、Vulkan、WebGPU 等
  • 核心实现无外部依赖
  • 可通过 Docker 或预构建二进制文件部署

采用前须知

  • 许可证:MIT。在使用、修改或分发项目前,请确认其具体条款。

评论

登录 后发表评论。

更多类似 llama.cpp 的项目

Favicon of DeepSeek-V3

DeepSeek-V3

Free 等级项目星标数: 104.5K

671B 参数混合专家语言模型,每 token 激活 37B

语言模型

DeepSeek-V3 是一款混合专家(MoE)语言模型,总参数量 671B,每个 token 激活 37B 参数。它支持 128K 上下文,提供 Base 与 Chat 两个版本,开放权重可用于本地部署,也可通过 API 使用。

Favicon of Qwen3-VL

Qwen3-VL

Free 等级项目星标数: 20K

Qwen 团队开发的多模态大语言模型系列

语言模型

Qwen3-VL 是 Qwen 团队(阿里巴巴云)开发的多模态大语言模型系列,提供密集和 MoE 架构,具备高级视觉推理、长上下文和扩展 OCR 能力。

Favicon of Qwen3

Qwen3

Free 等级项目星标数: 27.7K

阿里云 Qwen 团队开发的大型语言模型系列

语言模型

Qwen3 是阿里云 Qwen 团队开发的大型语言模型系列,包含稠密与混合专家(MoE)模型,提供思考与非思考模式,支持多语言、长上下文、推理、编码与智能体能力,并推出 2507 更新版本。