Qwen3-VL
Qwen3-VL 是 Qwen 团队(阿里巴巴云)开发的多模态大语言模型系列,提供密集和 MoE 架构,具备高级视觉推理、长上下文和扩展 OCR 能力。
访问 QwenLM/Qwen3-VL项目简介
Qwen3-VL 是 Qwen 团队(阿里巴巴云)开发的多模态大语言模型系列。它在文本理解与生成、视觉感知与推理、扩展上下文长度、空间与视频动态理解以及智能体交互能力等方面进行了全面升级。它提供从边缘到云端的密集和 MoE 架构,并有 Instruct 和推理增强的 Thinking 版本。
核心功能
- Visual Agent:操作 PC/移动 GUI——识别元素、理解功能、调用工具、完成任务。
- Visual Coding Boost:从图像/视频生成 Draw.io/HTML/CSS/JS。
- Advanced Spatial Perception:判断物体位置、视角和遮挡;提供更强的 2D 定位并支持 3D 定位。
- Long Context & Video Understanding:原生 256K 上下文,可扩展至 1M;处理书籍和数小时视频,具备完整回忆和秒级索引。
- Expanded OCR:支持 32 种语言(从 10 种升级);在低光、模糊和倾斜下稳健;更好地处理稀有/古代字符和术语。
- Enhanced Multimodal Reasoning:擅长 STEM/数学——因果分析和基于逻辑、证据的答案。
适用场景
- 全识别:识别动物、植物、人物、景点以及汽车和商品等各种物体。
- 文档解析:包含布局位置信息和 Qwen HTML 格式。
- 视频理解:包括视频 OCR、长视频理解和视频定位。
- 移动端和计算机使用代理:用于 GUI 控制。
快速开始
- 安装 transformers 4.57.0 或更高版本:pip install "transformers>=4.57.0"。
- 使用 ModelScope 下载检查点,尤其推荐中国大陆用户使用。
- 使用 Transformers 的 AutoModelForImageTextToText 和 AutoProcessor 加载 Qwen3-VL-235B-A22B-Instruct 等模型,然后应用聊天模板进行推理。
部署与要求
- 需要 transformers 4.57.0 或更高版本。
采用前须知
- 许可证:Apache-2.0。在使用、修改或分发项目前,请确认其具体条款。