生成字幕 — 从视频或音频自动生成

4.1 · 144 条评分

从任何视频或音频文件自动生成字幕 — 免费、隐私保护、在浏览器中进行。支持 22 种语言,文件最大 2 GB。导出为 SRT、VTT 及其他 8 种格式。

视频和音频转文本

拖放音频或视频文件来转录。

支持的格式: MP3, WAV, M4A, AAC, OGG, OGA, OPUS, FLAC, MP4, WEBM, M4V, MOV, MKV

由 Whisper AI 驱动 — 完全在你的设备上运行。

一次性下载 的选定质量 — 之后即时使用。

本地模型 — 导出前请审核和编辑;准确度可能不如付费云服务。

了解更多
SubtitleKit mascot

工作原理

  1. 1拖放一个音频或视频文件 — 所有数据都保留在你的设备上。
  2. 2选择语言,或让自动检测来处理。
  3. 3你的浏览器使用 Whisper AI 在本地进行转录——首次运行会下载一个针对你设备优化的一次性模型。
  4. 4检查、编辑,然后下载为 SRT、VTT 或纯文本格式。

完全在你的浏览器中运行。

从任何视频或音频自动生成字幕

SubtitleKit 是一个免费的 AI 字幕生成器,完全在你的浏览器中运行。拖入视频或音频文件(最大 2 GB),Whisper AI 在你的设备上生成精确时间码的字幕,支持 22 种语言,自动检测语言。无需注册,无水印。字幕在生成时实时显示,可以编辑并导出为 SRT、VTT 或其他 8 种字幕格式。

自动字幕生成的工作原理

Whisper AI 语音识别模型加载到你的浏览器中,监听媒体文件的音频轨道,并在你的设备上生成定时字幕。语音活动检测器标记语音的开始和结束位置,使字幕在自然停顿处分割,而不是在句子中间。你的数据不会离开设备——模型准备好后,字幕生成完全离线工作。

如何使用此工具

  • 拖入你的文件:将视频或音频文件拖入工具,或点击浏览。
  • 选择语言 — 选择所说的语言,或让自动检测为你识别。
  • 转录,你的浏览器使用 Whisper AI 在设备上完全离线转录文件。首次运行会下载一个一次性的 AI 模型,从手机上的约 24 MB 到最高精度级别的约 291 MB,根据你的设备自动选择。然后文本会实时出现。
  • 下载——审查并编辑字幕,然后将其下载为 SRT、VTT 或任何 10 种字幕格式,包括 ASS、LRC 歌词和 TTML。

什么是 AI 字幕生成器?

AI 字幕生成器是一种工具,它监听视频或音频文件中的语音,并自动为其编写带时间码的字幕,无需手动输入,无需手动同步。它为每一行生成带开始和结束时间的自动字幕,你可以微调并导出为 SRT 或 VTT 等字幕文件。SubtitleKit 直接在你的浏览器中运行 AI。

从一次转录生成每种字幕格式

一次转录,十种导出格式。从 MP3 录音生成 SRT 文件,直接从视频为 HTML5 播放器创建 VTT 文件,或从音频导出 LRC 歌词供音乐应用使用——相同的生成字幕可以即时本地转换为你的工作流所需的任何格式。

支持的输入文件

  • 视频:MP4、MOV、MKV、WebM 和 M4V——音频轨道自动提取。
  • 音频:MP3、WAV、M4A、AAC、OGG、Opus 和 FLAC 录音。
  • 文件最大 2 GB——包括完整电影、讲座和播客剧集。

导出格式

  • SRT——通用字幕标准,被每个视频编辑器和播放器接受。
  • VTT (WebVTT)——网络视频和 HTML5 播放器的原生字幕格式。
  • 另外还有 ASS/SSA 用于样式化字幕、SUB、SMI、SBV 用于 YouTube、LRC 用于同步歌词、TTML 用于广播,以及纯文本 TXT 转录。

为什么这个字幕生成器与众不同

大多数免费字幕生成器是云服务,有上传限制、队列和水印。SubtitleKit 在你自己的设备上完成繁重工作——并关注使字幕真正可用的细节。

  • 自然的字幕边界——语音活动检测器将每个字幕锚定到真实的语音停顿,使行在人类会停顿的地方分割,而不是在词中间。
  • 幻觉过滤——语音 AI 有时在静音或音乐上产生的重复或虚构的行会被自动检测和清理。
  • 离线工作——在一次性模型下载后,你可以在完全没有互联网连接的情况下生成字幕。
  • WebGPU 加速——在支持的台式机上,模型在你的显卡上运行,以显著加快转录速度。
  • 内置编辑器和音频播放——点击任何字幕可以听到你的录音的该段落,同时你可以修改文本和时间。

谁在使用此工具

内容创作者和视频博主

为 YouTube、Shorts 和 TikTok 视频自动生成字幕,以提高观看时间、覆盖静音观看的观众并提高搜索可见性——然后导出 SRT 或 SBV 准备上传。

无障碍和字幕

添加定时字幕,使你的内容对聋人和听力困难的观众有效,满足无障碍要求,并在静音自动播放源中保持可观看。

研究人员和记者

为录制的采访和现场素材生成字幕,便于搜索和引用。

教育工作者和学生

自动为讲座、教程和在线课程视频添加字幕,使课程更容易理解、可搜索和可复习——支持 22 种语言。

会议和商务

为录制的通话、网络研讨会和培训视频生成字幕,同时将机密录音保持在你自己的设备上——任何供应商都看不到音频。

语言学习者

为任何片段创建字幕,以便你可以边听边读,检查实际说了什么,并通过逐字幕音频播放来学习发音。

常见问题

字幕生成器是免费的吗?

是的。生成字幕完全免费——无需账户、无水印、无长度或文件限制(除了 2 GB 文件大小限制)——并且在你的浏览器中运行。

我的文件会被上传来生成字幕吗?

不会。你的媒体完全在你自己的设备上处理。没有任何内容上传到任何服务器,这也意味着没有上传限制和没有队列。

我可以从哪些文件生成字幕?

你可以从 MP4、MOV、MKV、WebM 和 M4V 视频,以及 MP3、WAV、M4A、AAC、OGG、Opus 和 FLAC 音频生成字幕——文件最大 2 GB。

自动生成的字幕准确度如何?

Whisper AI 模型在清晰语音上非常准确,幻觉过滤器可以清理语音 AI 在静音或音乐上产生的伪影。你可以在下载前编辑任何字幕——带有逐字幕音频播放。

字幕生成可以离线工作吗?

是的。AI 模型首次下载后,字幕在你的设备上生成,该工具完全离线工作。

我可以导出哪些字幕格式?

从一次转录导出十种格式——SRT、VTT、ASS、SSA、SUB、SMI、SBV、LRC、TTML 和纯文本 (TXT)。为编辑软件生成 SRT 文件,为网络播放器生成 VTT 文件,或为音乐应用生成 LRC 歌词。

生成字幕需要多长时间?

这取决于你的设备和录音的长度。在具有 WebGPU 图形加速的台式机上,转录通常比实时更快;在手机和较旧的机器上,会自动选择更小、更快的模型。

我可以在手机上生成字幕吗?

可以。该工具检测你的设备并加载一个紧凑的模型(约 24 MB),所以字幕生成也可以在移动浏览器上工作。

字幕生成器支持哪些语言?

你可以用该网站支持的 22 种语言生成字幕——包括英语、西班牙语、日语、韩语、中文、德语和阿拉伯语——并自动检测语言。底层 Whisper 模型理解大约 99 种语言。

中文字幕会以简体还是繁体字符输出?

默认为简体。语音模型本身会混合两种字体,因此该工具会在你的设备上将转录文本转换为简体中文。在语言菜单中选择"中文(繁体)"可保持字符完全按识别的方式显示。

我能免费为剪映(CapCut)制作自动字幕吗?

可以。在这里从你的视频或音频生成字幕,下载为 SRT 格式,然后将文件导入 剪映(CapCut)作为字幕。语音识别在你的浏览器中运行,所以没有订阅费用。

获得最佳效果的提示

使用清晰的音频 — 清晰、录制良好的语音,没有过多背景噪音,会产生最准确的结果。

为所说的音频选择正确的语言(或信任自动检测)— 选择正确的语言会显著提高准确性。

清晰的语音效果最好:对于包含音乐或背景噪音的录音,预计在导出前需要在编辑器中修正几行。

下载前编辑——点击一个字幕可以重放该段落,同时在内置编辑器中修复名称、标点符号和时间。