跳过主要内容
广告OpenFree logo推广你的产品触达更多潜在用户,助力产品增长与收益提升。投放广告
Favicon of Whisper

Whisper

Free 等级项目

Whisper 是一个通用语音识别模型,在大量多样化音频数据上训练,可执行多语言语音识别、语音翻译和语言识别。

访问 openai/whisper

项目简介

Whisper 是一个通用语音识别模型,在大量多样化音频数据上训练。它是一个多任务模型,可执行多语言语音识别、语音翻译和语言识别。它使用 Transformer 序列到序列模型,在多种语音处理任务上训练,包括语音活动检测,任务以 token 序列表示。

核心功能

  • 多语言语音识别
  • 语音翻译
  • 语言识别
  • 语音活动检测
  • 多种模型尺寸(tiny 到 turbo),在速度和准确率之间权衡

适用场景

  • 使用命令行或 Python API 转录音频文件中的语音
  • 将非英语语音翻译成英语
  • 检测音频中的口语语言
  • 使用滑动 30 秒窗口处理长录音

快速开始

  • 通过 pip install -U openai-whisper 安装。系统需安装 ffmpeg。Python 用法:使用 whisper.load_model('turbo') 加载模型,然后对音频文件调用 transcribe。命令行用法:whisper audio.flac --model turbo。

部署与要求

  • 需要 Python 3.8-3.11 和 PyTorch。需要 ffmpeg。模型尺寸对 VRAM 的要求从约 1 GB 到约 10 GB 不等。如果 tiktoken 未提供预构建 wheel,可能需要 Rust。

采用前须知

  • 许可证:MIT。在使用、修改或分发项目前,请确认其具体条款。

评论

登录 后发表评论。