DeepSeek-V3
DeepSeek-V3 是一款混合专家(MoE)语言模型,总参数量 671B,每个 token 激活 37B 参数。它支持 128K 上下文,提供 Base 与 Chat 两个版本,开放权重可用于本地部署,也可通过 API 使用。
访问 deepseek-ai/DeepSeek-V3项目简介
DeepSeek-V3 是一款混合专家(MoE)语言模型,总参数量 671B,每个 token 激活 37B 参数。它采用多头潜在注意力(MLA)与 DeepSeekMoE 架构,使用无辅助损失的负载均衡策略和多 token 预测目标。模型在 14.8 万亿 token 上预训练,随后经过监督微调与强化学习阶段;评估显示其在数学和代码任务上表现突出,并支持 128K 上下文窗口。
核心功能
- 总参数量 671B,每个 token 激活 37B 参数。采用多头潜在注意力(MLA)和 DeepSeekMoE 架构。使用无辅助损失的负载均衡策略,以减少因鼓励负载均衡而带来的性能下降。采用多 token 预测(MTP)训练目标,该目标也可用于推测解码。设计 FP8 混合精度训练框架,并在超大规模模型上验证其可行性与有效性。在 14.8 万亿 token 上预训练,支持 128K 上下文长度,提供 Base 与 Chat 版本。
适用场景
- 通过 DeepSeek 官网或 OpenAI 兼容 API 与 DeepSeek-V3 对话。使用 DeepSeek-Infer Demo、SGLang、LMDeploy、TensorRT-LLM、vLLM 或 LightLLM 进行本地推理和部署。处理模型在基准测试中表现较强的代码和数学任务。研究 MoE 架构、FP8 训练、多 token 预测以及从 DeepSeek-R1 进行推理蒸馏。
快速开始
- 克隆 DeepSeek-V3 GitHub 仓库,并进入 inference 文件夹。在新建的 conda 或 uv 虚拟环境中,从 requirements.txt 安装依赖。从 Hugging Face 下载模型权重并放入本地文件夹。使用 convert.py 并按所需的专家数和模型并行设置转换 Hugging Face 模型权重。使用提供的配置,通过 torchrun 和 generate.py 运行交互式或批量推理。
部署与要求
- DeepSeek-Infer Demo 仅支持 Linux 与 Python 3.10;不支持 Mac 和 Windows。DeepSeek-Infer Demo 依赖包括 torch 2.4.1、triton 3.0.0、transformers 4.46.3 和 safetensors 0.4.5。官方仅提供 FP8 权重;如需 BF16 权重,可使用提供的 fp8_cast_bf16.py 转换脚本生成。Hugging Face Transformers 尚未直接支持。SGLang 在 BF16 和 FP8 模式下支持 NVIDIA 与 AMD
采用前须知
- 许可证:MIT。在使用、修改或分发项目前,请确认其具体条款。
- GitHub 记录的最后推送日期为 2025-08-28,距采集时间已至少 12 个月;采用前建议进一步确认维护状态。