跳过主要内容
广告OpenFree logo推广你的产品触达更多潜在用户,助力产品增长与收益提升。投放广告
Favicon of DeepSeek-V3

DeepSeek-V3

Free 等级项目

DeepSeek-V3 是一款混合专家(MoE)语言模型,总参数量 671B,每个 token 激活 37B 参数。它支持 128K 上下文,提供 Base 与 Chat 两个版本,开放权重可用于本地部署,也可通过 API 使用。

访问 deepseek-ai/DeepSeek-V3

项目简介

DeepSeek-V3 是一款混合专家(MoE)语言模型,总参数量 671B,每个 token 激活 37B 参数。它采用多头潜在注意力(MLA)与 DeepSeekMoE 架构,使用无辅助损失的负载均衡策略和多 token 预测目标。模型在 14.8 万亿 token 上预训练,随后经过监督微调与强化学习阶段;评估显示其在数学和代码任务上表现突出,并支持 128K 上下文窗口。

核心功能

  • 总参数量 671B,每个 token 激活 37B 参数。采用多头潜在注意力(MLA)和 DeepSeekMoE 架构。使用无辅助损失的负载均衡策略,以减少因鼓励负载均衡而带来的性能下降。采用多 token 预测(MTP)训练目标,该目标也可用于推测解码。设计 FP8 混合精度训练框架,并在超大规模模型上验证其可行性与有效性。在 14.8 万亿 token 上预训练,支持 128K 上下文长度,提供 Base 与 Chat 版本。

适用场景

  • 通过 DeepSeek 官网或 OpenAI 兼容 API 与 DeepSeek-V3 对话。使用 DeepSeek-Infer Demo、SGLang、LMDeploy、TensorRT-LLM、vLLM 或 LightLLM 进行本地推理和部署。处理模型在基准测试中表现较强的代码和数学任务。研究 MoE 架构、FP8 训练、多 token 预测以及从 DeepSeek-R1 进行推理蒸馏。

快速开始

  • 克隆 DeepSeek-V3 GitHub 仓库,并进入 inference 文件夹。在新建的 conda 或 uv 虚拟环境中,从 requirements.txt 安装依赖。从 Hugging Face 下载模型权重并放入本地文件夹。使用 convert.py 并按所需的专家数和模型并行设置转换 Hugging Face 模型权重。使用提供的配置,通过 torchrun 和 generate.py 运行交互式或批量推理。

部署与要求

  • DeepSeek-Infer Demo 仅支持 Linux 与 Python 3.10;不支持 Mac 和 Windows。DeepSeek-Infer Demo 依赖包括 torch 2.4.1、triton 3.0.0、transformers 4.46.3 和 safetensors 0.4.5。官方仅提供 FP8 权重;如需 BF16 权重,可使用提供的 fp8_cast_bf16.py 转换脚本生成。Hugging Face Transformers 尚未直接支持。SGLang 在 BF16 和 FP8 模式下支持 NVIDIA 与 AMD

采用前须知

  • 许可证:MIT。在使用、修改或分发项目前,请确认其具体条款。
  • GitHub 记录的最后推送日期为 2025-08-28,距采集时间已至少 12 个月;采用前建议进一步确认维护状态。

评论

登录 后发表评论。

更多类似 DeepSeek-V3 的项目

Favicon of Qwen3-VL

Qwen3-VL

Free 等级项目星标数: 20K

Qwen 团队开发的多模态大语言模型系列

语言模型

Qwen3-VL 是 Qwen 团队(阿里巴巴云)开发的多模态大语言模型系列,提供密集和 MoE 架构,具备高级视觉推理、长上下文和扩展 OCR 能力。

Favicon of Qwen3

Qwen3

Free 等级项目星标数: 27.7K

阿里云 Qwen 团队开发的大型语言模型系列

语言模型

Qwen3 是阿里云 Qwen 团队开发的大型语言模型系列,包含稠密与混合专家(MoE)模型,提供思考与非思考模式,支持多语言、长上下文、推理、编码与智能体能力,并推出 2507 更新版本。

Favicon of llama.cpp

llama.cpp

Free 等级项目星标数: 129.5K

C/C++ 实现的 LLM 推理

语言模型

用 C/C++ 实现 LLM 推理,以最简设置和一流性能在本地和云端的各种硬件上运行。