跳过主要内容
广告OpenFree logo推广你的产品触达更多潜在用户,助力产品增长与收益提升。投放广告
Favicon of VideoLingo

VideoLingo

Free 等级项目

VideoLingo 将语音识别、字幕翻译、分段对齐和配音整合到 Streamlit 界面,一键生成字幕文件,也可输出带字幕或配音的视频,用于视频本地化;翻译质量取决于源音频、语言和所选模型。

访问 Huanshere/VideoLingo

项目简介

VideoLingo 是一款 AI 视频本地化工具,将语音识别、字幕翻译、分段、对齐和配音整合在 Streamlit 界面中。它会生成字幕文件,并可选择输出带字幕或配音的视频。翻译质量取决于源音频、语言和所选模型。

核心功能

  • 智能字幕分段:利用 NLP 和 LLM 技术根据句意准确切分字幕,确保每组短语长度合适。
  • 上下文感知翻译:GPT 总结并提取术语知识库,实现上下文连贯的翻译,使每句自然流畅。
  • 三步翻译流程:直译、反思、意译,多重保障,质量可媲美专业字幕组翻译。
  • 精准字幕对齐:使用 Qwen3-ASR 与 Qwen3-ForcedAligner 进行词级时间轴字幕识别,确保每个词准确同步。
  • 高质量配音:支持多种 TTS 方案,包括 GPT-SoVITS 个性化配音,让视频更具吸引力。
  • YouTube 视频下载:通过 yt-dlp 下载视频,并在 Streamlit 中一键启动和处理。

适用场景

  • 通过生成翻译字幕和可选的配音音轨来本地化视频。
  • 为视频创建双语字幕。
  • 使用 GPT-SoVITS 或其他 TTS 方法以克隆声音为视频配音。
  • 通过多语言字幕和配音工作流处理 YouTube 视频。

快速开始

  • 在 Windows 上,从最新 Release 下载 Source code (zip),解压到桌面或其他文件夹,双击 OneKeyStart.bat 并保持窗口打开;首次运行会自动安装 uv、Python 3.12、应用依赖和 FFmpeg,需要联网。
  • 安装后 VideoLingo 会自动在浏览器中打开;在侧边栏输入 API URL、密钥和模型即可开始使用。
  • 在 Windows、macOS 或 Linux 上从源码安装:克隆仓库后运行 uv run start.py。
  • 使用 HTTP API 时,配置 config.yaml,并从项目根目录运行 uv run start.py --api。

部署与要求

  • 支持 Windows、macOS(Apple Silicon / Intel)和 Linux。
  • Windows 一键安装首次运行需要联网,并安装 uv、Python 3.12、应用依赖和 FFmpeg。
  • Linux NVIDIA 容器 Docker 部署需要安装 Docker、兼容的 GPU 驱动和 NVIDIA Container Toolkit;镜像默认使用 Python 3.12 和 CUDA 12.8.1/cu128。
  • 使用 LLM 需要 OpenAI 兼容的 Chat Completions 提供商和模型,并能返回工作流所需的结构化 JSON。
  • 语音识别默认在本地运行 Qwen3-ASR 与 Qwen3-ForcedAligner,也可选择 ElevenLabs 或 MAI-Transcribe-2。

采用前须知

  • 许可证:Apache-2.0。在使用、修改或分发项目前,请确认其具体条款。

评论

登录 后发表评论。

更多类似 VideoLingo 的项目

Favicon of VidBee

VidBee

Free 等级项目星标数: 10.8K

下载视频并在本机生成可搜索的转录文本。

助手与生产力转录与听写

VidBee 可从 YouTube、TikTok、Instagram、X 等 1000+ 网站下载视频,也可导入本地文件。它会在你的电脑上创建可搜索、带时间戳的转录文本,方便定位具体片段、导出文本,或用你选择的 AI 提供商进行摘要和翻译。

Favicon of Whisper

Whisper

Free 等级项目星标数: 109.6K

通用语音识别模型

转录与听写

Whisper 是一个通用语音识别模型,在大量多样化音频数据上训练,可执行多语言语音识别、语音翻译和语言识别。