采访转录:免费,带说话人标签

在浏览器中免费将采访转录为文本。标记谁在说话,重命名说话人,导出 TXT、SRT 或 VTT 格式并带上名字。

视频和音频转文本

拖放音频或视频文件来转录。

支持的格式: MP3, WAV, M4A, AAC, OGG, OGA, OPUS, FLAC, MP4, WEBM, M4V, MOV, MKV

由 Whisper AI 驱动 — 完全在你的设备上运行。

一次性下载 的选定质量 — 之后即时使用。

本地模型 — 导出前请审核和编辑;准确度可能不如付费云服务。

了解更多
SubtitleKit mascot

工作原理

  1. 1拖放一个音频或视频文件 — 所有数据都保留在你的设备上。
  2. 2选择语言,或让自动检测来处理。
  3. 3你的浏览器使用 Whisper AI 在本地进行转录——首次运行会下载一个针对你设备优化的一次性模型。
  4. 4检查、编辑,然后下载为 SRT、VTT 或纯文本格式。

完全在你的浏览器中运行。

如何免费转录采访,带说话人标签

将采访录音转变为清晰的转录文本,显示谁说了什么。拖入音频或视频,让 Whisper AI 在你的浏览器中写出文本,然后用一个按键为每一行标记为采访者或受访者。无需账户、无分钟限制、无水印。

采访转录在这里如何工作

Whisper AI 模型加载到你的浏览器中,在你自己的设备上转录录音。文本准备好后,说话人标签已经打开:点击或按 Tab 到某一行的说话人标签,然后按 1 或 2 标记谁在说话;为小组讨论添加说话人并按其编号。将采访者和受访者重命名为真实名字,每次导出都会包含它们。

如何转录采访

  • 添加录音:拖入采访音频(MP3、WAV、M4A)或视频(MP4、MOV、MKV),最大 2 GB。
  • 选择语言:设置所说的语言,或保持自动检测开启。
  • 转录并标记说话人:文本出现后,点击或按 Tab 到某一行的说话人标签,然后按 1 表示采访者或 2 表示受访者。为小组讨论添加更多说话人。
  • 重命名并导出:给每个说话人取真实名字,然后下载纯文本用于引用,或下载 SRT 和 VTT 用于已发布的视频采访。

输入和输出格式

任何常见的采访录音都可以,每次导出都会用该格式自己的约定保留你的说话人标签。

  • 音频:MP3、WAV、M4A、AAC、OGG、Opus、FLAC
  • 视频:MP4、MOV、MKV、WebM、M4V
  • 转录:TXT,每个说话人轮次一个段落,每个段落以说话人名字开头
  • 字幕:SRT、VTT(带语音标签)、ASS 等,说话人改变时显示名字

谁用它转录采访

记者

获取采访源的可引用文字记录,每一行都有标注,并将录音保存在你的电脑上。

学术与论文研究

为论文或研究转录定性访谈,按参与者标记,并将 TXT 导入 MAXQDA、ATLAS.ti 或 NVivo 进行编码。音频在你的设备上处理,这有助于符合伦理委员会和数据保护规则。

播客制作者

将两人一集的节目转换为节目说明和可搜索的文字记录,主持人和嘉宾都有标注。

用户体验与市场研究

转录用户访谈和客户通话,然后按参与者提取引用内容到你的研究结果中。

人力资源与招聘

保留候选人和面试官清晰分离的录制访谈的准确记录。

口头历史与家族故事

将亲属或社区成员的回忆保存为可读的、有标注的文字记录。

常见问题

访谈转录是免费的吗?

是的:免费,无需账户、水印、分钟数限制或按分钟计费。转录在你的浏览器中运行,所以没有任何费用。

说话人标签如何工作?

你来标记。转录后,每一行都有一个说话人芯片:按 1 表示采访者,按 2 表示嘉宾。对于小组讨论,先添加说话人,然后按其编号(最多 9 个)。重命名任何一个。说话人目前还不能自动检测,所以最简单的方法是在校对时标记行。

我的访谈录音会被上传吗?

不会。音频在你自己的设备上转录,不会发送到服务器。只有 AI 模型会被下载一次,然后由你的浏览器缓存。

我可以转录哪些文件,我会得到什么?

常见音频(MP3、WAV、M4A、AAC、OGG、Opus、FLAC)和视频(MP4、MOV、MKV、WebM、M4V)文件。你可以下载纯文本(每个说话人轮次一段),或包含说话人名字的字幕,如 SRT 和 VTT。

访谈可以有多长?

最多 4 小时音频,文件大小最多 2 GB。长录音需要更长时间并使用更多内存,所以对于超过一小时的任何内容,桌面或笔记本电脑浏览器效果最好。

我如何获得最准确的文字记录?

从你拥有的最清晰的录音开始,手动设置所说的语言,并在发布任何内容之前根据音频校对名字、数字和引用。

获得更好访谈文字记录的建议

使用原始录音:每个人用单独的麦克风比一部手机放在桌子上效果更好,原始文件比压缩导出效果更好。

如果你知道语言,请手动设置。自动检测只听开头几秒钟,而访谈通常以闲聊开始。

校对时标记:读每一行,按其说话人编号,并在同一遍中修复文本。

导出前重命名:文字记录中的真实姓名可以省去之后的查找和替换,姓名会传入每种格式。