
VideoLingo
VideoLingo 将语音识别、字幕翻译、分段对齐和配音整合到 Streamlit 界面,一键生成字幕文件,也可输出带字幕或配音的视频,用于视频本地化;翻译质量取决于源音频、语言和所选模型。
访问 Huanshere/VideoLingo项目简介
VideoLingo 是一款 AI 视频本地化工具,将语音识别、字幕翻译、分段、对齐和配音整合在 Streamlit 界面中。它会生成字幕文件,并可选择输出带字幕或配音的视频。翻译质量取决于源音频、语言和所选模型。
核心功能
- 智能字幕分段:利用 NLP 和 LLM 技术根据句意准确切分字幕,确保每组短语长度合适。
- 上下文感知翻译:GPT 总结并提取术语知识库,实现上下文连贯的翻译,使每句自然流畅。
- 三步翻译流程:直译、反思、意译,多重保障,质量可媲美专业字幕组翻译。
- 精准字幕对齐:使用 Qwen3-ASR 与 Qwen3-ForcedAligner 进行词级时间轴字幕识别,确保每个词准确同步。
- 高质量配音:支持多种 TTS 方案,包括 GPT-SoVITS 个性化配音,让视频更具吸引力。
- YouTube 视频下载:通过 yt-dlp 下载视频,并在 Streamlit 中一键启动和处理。
适用场景
- 通过生成翻译字幕和可选的配音音轨来本地化视频。
- 为视频创建双语字幕。
- 使用 GPT-SoVITS 或其他 TTS 方法以克隆声音为视频配音。
- 通过多语言字幕和配音工作流处理 YouTube 视频。
快速开始
- 在 Windows 上,从最新 Release 下载 Source code (zip),解压到桌面或其他文件夹,双击 OneKeyStart.bat 并保持窗口打开;首次运行会自动安装 uv、Python 3.12、应用依赖和 FFmpeg,需要联网。
- 安装后 VideoLingo 会自动在浏览器中打开;在侧边栏输入 API URL、密钥和模型即可开始使用。
- 在 Windows、macOS 或 Linux 上从源码安装:克隆仓库后运行 uv run start.py。
- 使用 HTTP API 时,配置 config.yaml,并从项目根目录运行 uv run start.py --api。
部署与要求
- 支持 Windows、macOS(Apple Silicon / Intel)和 Linux。
- Windows 一键安装首次运行需要联网,并安装 uv、Python 3.12、应用依赖和 FFmpeg。
- Linux NVIDIA 容器 Docker 部署需要安装 Docker、兼容的 GPU 驱动和 NVIDIA Container Toolkit;镜像默认使用 Python 3.12 和 CUDA 12.8.1/cu128。
- 使用 LLM 需要 OpenAI 兼容的 Chat Completions 提供商和模型,并能返回工作流所需的结构化 JSON。
- 语音识别默认在本地运行 Qwen3-ASR 与 Qwen3-ForcedAligner,也可选择 ElevenLabs 或 MAI-Transcribe-2。
采用前须知
- 许可证:Apache-2.0。在使用、修改或分发项目前,请确认其具体条款。
