音频转写省掉的是第一遍听写,并不代表输出后就结束了。真正能用的结果,应该把人名校对好、说话人分清楚,重要内容还能回到录音里核对。
下面这套方法适合访谈、语音笔记、课程和播客。重点不是逐字从头听到尾,而是把时间花在最容易出错的地方。
核心要点
- 尽量上传最清晰的原始录音。
- 知道主要语言时直接选择,不必依赖猜测。
- 用时间点回听人名、数字和不确定段落。
- 先校对原文,再翻译或导出。
1. 先整理录音
优先使用原始音频,不要用聊天软件多次转发后的版本。反复压缩会让辅音变得含糊,距离较远的人声也更难分辨。
如果开头有很长的空白或无关闲聊,可以先剪掉。它未必能提高识别率,但会让后续查找和校对轻松很多。
- 一场会议或一次访谈保留为一个文件。
- 戴耳机确认左右声道都能听清。
- 提前记下生僻人名、产品名和缩写。
2. 设置要和录音匹配
- 1
选择主要语言
自动检测很方便,但如果已经知道语言,直接选择可以少一次误判。
- 2
对话内容开启说话人识别
访谈和会议适合打开;单人语音笔记通常没有必要。
- 3
根据后续用途选择输出
纯文字方便继续整理,时间点方便回听,字幕文件则保留了每句话的出现时间。
3. 按优先级校对
先看置信度较低、读起来明显不顺的段落,再集中搜索人名、数字、金额、日期和专业词。遇到听不清的位置,连同前后几秒一起听,通常比反复播放单个词更容易判断。
说话人标签最好单独检查一次。系统可以判断声音发生了变化,却不知道对方的真实姓名,确认身份后再把 Speaker 1 之类的标签改掉。
校对引用内容时不要顺手把口语改得更漂亮。需要忠实记录时,只修正识别错误,保留说话人原本的表达。
4. 原文校对好,再开始翻译
人名或数字如果在原文里就识别错了,进入译文后往往更难发现。先完成重点校对,再选择目标语言,并重点检查专业词、固定说法和关键信息。
翻译会沿用每段的时间点和说话人,不必另外整理一份脱离音频的文档。原始转写也不会被覆盖,可以随时对照。
准备公开发布的内容,最好再由熟悉目标语言的人检查人名、习惯表达、专业词和依赖本地语境的说法。
5. 按下一步工作导出
- TXT:整理笔记、归档、搜索和继续写作。
- 译文 TXT:不需要时间点时直接使用。
- SRT:导出原文或译文视频字幕。
- 双语 SRT:让原文和译文同时出现在字幕中。
- VTT:保留原文,用于网页播放器。
常见问题
音频转文字需要多久?
时间取决于文件长度、任务队列和所选设置。长文件会在后台处理,可稍后从历史记录重新打开。
要不要用自动检测语言?
不知道录音语言时可以使用。如果已经知道主要语言,直接选择通常更稳。
翻译后还会保留时间点吗?
会。翻译沿用原来的分段、时间点和说话人,可导出译文 TXT、译文 SRT 或双语 SRT,也不会覆盖原始转写。
转写完成后能直接发布吗?
更适合把它当成一份质量较高的初稿。发布前仍应检查人名、数字、专业词,以及多人重叠或距离较远的语音。
