Qwen3
Qwen3 是阿里云 Qwen 团队开发的大型语言模型系列,包含稠密与混合专家(MoE)模型,提供思考与非思考模式,支持多语言、长上下文、推理、编码与智能体能力,并推出 2507 更新版本。
访问 QwenLM/Qwen3项目简介
Qwen3 是阿里云 Qwen 团队开发的大型语言模型系列。该系列包含稠密与混合专家(MoE)模型,参数规模从 0.6B 到 235B-A22B,并推出 Qwen3-2507 的 Instruct 与 Thinking 变体,覆盖 235B-A22B、30B-A3B 和 4B 等尺寸。模型支持思考与非思考模式,适用于推理与对话,具备多语言、长上下文理解能力,并可在多种框架中部署或本地运行。
核心功能
- 稠密与混合专家(MoE)模型,参数规模包括 0.6B、1.7B、4B、8B、14B、32B、30B-A3B 和 235B-A22B。
- Qwen3-2507 提供 Instruct 与 Thinking 变体,覆盖 235B-A22B、30B-A3B 和 4B 尺寸。
- 支持在思考模式(用于复杂逻辑推理、数学与编码)与非思考模式(用于高效通用对话)之间切换。
- 支持 100 多种语言和方言,具备多语言指令遵循与翻译能力。
- 支持 256K 令牌长上下文理解,Qwen3-2507 可扩展至 100 万令牌。
- 具备智能体能力,可与外部工具精确集成并处理复杂智能体任务。
适用场景
- 复杂逻辑推理、数学、科学和编码任务。
- 高效通用对话、创意写作、角色扮演和多轮对话。
- 覆盖 100 多种语言和方言的多语言指令遵循与翻译。
- 需要与外部工具集成的工具使用和复杂智能体任务。
快速开始
- 使用 Transformers 时需安装 transformers>=4.51.0,通过 AutoModelForCausalLM 和 AutoTokenizer 加载 Qwen3 检查点,应用聊天模板并生成文本。中国大陆用户推荐使用 ModelScope,它提供类似 Transformers 的 Python API 以及 modelscope download 命令行工具。其他本地运行选项包括 llama.cpp、Ollama、LMStudio、ExecuTorch、MNN、MLX LM 和 OpenVINO。
部署与要求
- 使用 Transformers 需要 transformers>=4.51.0,建议使用最新版本。
- 使用 SGLang 服务需要 sglang>=0.4.6.post1。
- 使用 vLLM 服务建议 vllm>=0.9.0。
- 使用 TensorRT-LLM 服务建议 tensorrt_llm>=0.20.0rc3。
- 使用 llama.cpp 完整支持 Qwen3 建议 llama.cpp>=b5401。
采用前须知
- 未检测到可识别的许可证;采用前请核实项目的使用、修改和分发权限。