Whisper
Whisper 是一个通用语音识别模型,在大量多样化音频数据上训练,可执行多语言语音识别、语音翻译和语言识别。
访问 openai/whisper项目简介
Whisper 是一个通用语音识别模型,在大量多样化音频数据上训练。它是一个多任务模型,可执行多语言语音识别、语音翻译和语言识别。它使用 Transformer 序列到序列模型,在多种语音处理任务上训练,包括语音活动检测,任务以 token 序列表示。
核心功能
- 多语言语音识别
- 语音翻译
- 语言识别
- 语音活动检测
- 多种模型尺寸(tiny 到 turbo),在速度和准确率之间权衡
适用场景
- 使用命令行或 Python API 转录音频文件中的语音
- 将非英语语音翻译成英语
- 检测音频中的口语语言
- 使用滑动 30 秒窗口处理长录音
快速开始
- 通过 pip install -U openai-whisper 安装。系统需安装 ffmpeg。Python 用法:使用 whisper.load_model('turbo') 加载模型,然后对音频文件调用 transcribe。命令行用法:whisper audio.flac --model turbo。
部署与要求
- 需要 Python 3.8-3.11 和 PyTorch。需要 ffmpeg。模型尺寸对 VRAM 的要求从约 1 GB 到约 10 GB 不等。如果 tiktoken 未提供预构建 wheel,可能需要 Rust。
采用前须知
- 许可证:MIT。在使用、修改或分发项目前,请确认其具体条款。