音频转文本 — 浏览器中免费的 AI 转录

4.2 · 24 条评分

免费将音频转录为文本,MP3、WAV、M4A、语音备忘录、播客。在你的浏览器中运行。下载转录为 TXT 或字幕。

音频转文本

拖放音频文件以转录。

支持的格式: MP3, WAV, M4A, AAC, OGG, OGA, OPUS, FLAC

由 Whisper AI 驱动 — 完全在你的设备上运行。

一次性下载 的选定质量 — 之后即时使用。

本地模型 — 导出前请审核和编辑;准确度可能不如付费云服务。

了解更多
SubtitleKit mascot

工作原理

  1. 1拖放一个音频或视频文件 — 所有数据都保留在你的设备上。
  2. 2选择语言,或让自动检测来处理。
  3. 3你的浏览器使用 Whisper AI 在本地进行转录——首次运行会下载一个针对你设备优化的一次性模型。
  4. 4检查、编辑,然后下载为 SRT、VTT 或纯文本格式。

完全在你的浏览器中运行。

音频转文字:免费在线转录,数据留在你的设备上

SubtitleKit 直接在你的浏览器中将音频转录为文本,无需账户,无需按分钟计费。拖入 MP3、WAV、M4A 或任何常见的录音(最大 2 GB),Whisper AI 在你的设备上生成转录文本,支持 22 种语言,自动检测语言。文本实时显示,可以编辑并下载为干净的 TXT 转录文本,或者如果你需要字幕,可以下载为 SRT/VTT 格式。

音频转录的工作原理

Whisper AI 语音识别模型加载到你的浏览器中,听你的录音,并在你自己的机器上将语音转换为文本。这就是为什么它是免费的,也是为什么没有排队。一次性模型下载后,它可以完全离线工作。

如何将音频转录为文字

  • 拖入你的录音:拖入 MP3、WAV、M4A 或其他音频文件(最大 2 GB),或点击浏览。
  • 选择语言——选择所说的语言,或让自动检测从录音的前几秒钟识别语言。
  • 转录(你的浏览器使用 Whisper AI 在设备上将语音转换为文本;首次运行会下载一个一次性模型(约 24-291 MB,根据你的设备自动调整),页面上的选择器会显示确切大小),然后文本会实时流入。
  • 下载你的转录文本——导出清晰的纯文本(TXT)用于文档和笔记——或保留时间码并下载 SRT 或 VTT 字幕。

将任何音频格式转录为文字

录音来自各种来源——播客编辑、手机、语音聊天、现场录音机。它们都以相同的方式转录,在本地进行且完全免费。

  • MP3 转文字——播客剧集、下载的音频和语音备忘录变成可搜索的转录文本。
  • WAV 转文字——录音室会话、采访录音机和原始录音无需转换即可转录。
  • M4A 和 AAC 转文字——iPhone 语音备忘录和手机录音完全按原样工作。
  • OGG、Opus 和 FLAC 转文字——语音聊天导出和无损档案完全支持。

谁在使用这个工具

播客主和内容创作者

将每一集转换为完整转录文本,用于节目说明、博客文章和 SEO——免费音频转录,无论后期目录有多长都无需按分钟付费。

无障碍访问和字幕

在音频旁边发布转录文本,让你的内容能够被聋人和听力障碍人士访问——当播放器需要字幕时切换到 SRT/VTT 导出。

记者和采访

将采访音频转录为可引用、可搜索的文本,无需将录音交给云服务——信息源保留在你的设备上。

学生和讲座

将录制的讲座和研讨会转换为你可以搜索和标记的笔记,而不是在考试前花费数小时浏览音频。

会议和语音备忘录

将录制的通话和语音备忘录转录为会议记录和行动项。

语言学习者

在听音频时阅读转录文本以检查实际说了什么、重放任何一行,以及在上下文中学习词汇。

常见问题

音频转文字转录是免费的吗?

是的——完全免费,无需账户、无需按分钟付费、无需水印,也没有转录文件数量的限制。它在你的浏览器中运行。

我的音频会被上传吗?

不会。录音 100% 在你自己的设备上转录,永远不会上传到任何服务器——你的音频副本不会存在于其他任何地方。

我可以转录哪些音频格式?

MP3、WAV、M4A、AAC、OGG、Opus 和 FLAC——加上 MP4 和 MOV 等视频文件,其音频轨道会自动提取。文件最大 2 GB。

转录的准确度如何?

使用 Whisper AI 模型,清晰的语音转录非常准确,幻觉过滤器可以消除静音和背景音乐可能导致的伪影。你可以在下载前编辑每一行——带有逐行音频重放功能。

它可以转录哪些语言?

该网站支持的 22 种语言,具有自动语言检测功能——底层 Whisper 模型理解大约 99 种语言。

我如何将 iPhone 语音备忘录转录为文字?

将语音备忘录分享或保存为文件(它是 M4A 格式),拖到这个页面,然后下载转录文本。

我可以获得字幕而不是纯文本吗?

可以。相同的转录可以导出为定时 SRT 或 VTT 字幕——或者如果字幕是你的主要目标,可以使用音频转 SRT 和字幕生成工具。

音频转录可以离线工作吗?

可以。在一次性 AI 模型下载后,转录完全在你的设备上运行,无需互联网连接。

我能在转录中标记谁在说话吗?

可以。转录后,打开说话人开关,点击某行的说话人标签(或按 Tab 到它)并按 1-9 标记其说话人,然后将说话人 1 或说话人 2 重命名为真实名字。SRT 和大多数格式在说话人改变时会获得 Name: 前缀,VTT 获得正确的语音标签,纯文本将每个说话人的轮次分组为一个段落。

获得准确转录的提示

使用原始录音——直接从你的录音机或手机获取的文件比压缩重新导出的文件转录效果更好。

当你知道所说的语言时手动设置——自动检测很可靠,但明确选择可以消除短音频或嘈杂音频的任何风险。

长录音没问题:每个文件最大 2 GB,所以两小时的采访可以一次性转录。

校对名字和数字——点击任何一行在你更正拼写和数字时重放音频的那部分。