跳到主要内容
VVimorph
剪辑画面、音频波形和带时间点的字幕块

视频怎么转成文字,并导出 SRT 字幕

从视频音轨识别并校对文字,按需翻译,再导出原文、译文或双语 SRT 字幕。

2026 年 9 月 11 日·阅读约 8 分钟·Vimorph 编辑团队

视频转写和生成字幕都从同一条音轨开始,区别在识别之后。文字稿可以写成长段,字幕却要短、时间准确,还要让观众在看画面的同时来得及读完。

这篇讲完整流程,也列出 SRT 交给剪辑或发布平台前最值得检查的几处。

核心要点

  • 尽量使用已经定剪的视频。
  • 重点检查转场、停顿和快速对话的时间。
  • 按语义断句,不要只按字数截断。
  • 先校对原文,再翻译和导出字幕。

1. 先确定视频版本

粗剪阶段就做字幕,后面删镜头、换顺序时会产生很多重复工作。尽量使用定剪版,至少保证对白轨道和时间线不再变化。

视频里有音乐和音效时,要确认对白仍然清楚。背景声过大时,人耳可能勉强听懂,词尾却容易被识别错。

2. 生成带时间点的文字

  1. 1

    上传视频

    选择 MP4、MOV、WebM 或其他支持的媒体格式。

  2. 2

    设置源语言

    这里选视频里实际说的语言,不是之后准备翻译成的语言。

  3. 3

    生成字幕

    保留时间点,让每个片段都能对应回视频时间线。

3. 按屏幕阅读方式调整

先修正识别错误,再处理字幕断句。人名和短语尽量放在一起,不要把介词留在行尾,也别把动词和补充成分拆开。

完整播放转场和语速较快的段落。时间码即使数值没错,如果人物已经开口后字幕才出现,观看时仍会觉得慢。

定剪后如果又修改了镜头,应从第一个变动点往后重新校时,不要随机修几个单句。

4. 校对原文后再翻译字幕

先把源语言里的识别错误改好,再选择目标语言。译文会沿用原来的时间点和说话人,既方便逐段对照,也不需要重新整理时间线。

字幕翻译和完整的视频翻译不是一回事:这里改变的是屏幕上的文字,不会把原视频声音替换成目标语言配音。如果成片还需要翻译后的人声,应使用视频翻译功能。

  • 译文 SRT:提供给只需要目标语言的观众。
  • 双语 SRT:在同一个时间段里同时显示原文和译文。
  • 发布前重点检查人名、习惯表达、行长和阅读速度。

5. 选择合适的文件

  • SRT:剪辑软件和视频平台普遍支持。
  • 双语 SRT:每个字幕时间段同时包含原文和译文。
  • VTT:保留原文,用于网页视频。
  • TXT:适合视频简介、文章和内部审核。
  • 保留源项目,后续修正后还能重新导出。

常见问题

MP4 可以直接转成文字吗?

可以,不需要先手动提取音频,系统会识别视频中的音轨。

SRT 和 VTT 有什么区别?

两者都保存带时间的字幕。SRT 常用于剪辑和分发,VTT 是网页视频常用格式,并支持额外的提示信息。

字幕翻译会改变视频声音吗?

不会。这里生成的是译文或双语字幕;如果还需要目标语言配音,应使用完整的视频翻译功能。

字幕必须和文字稿逐字一致吗?

意思应该保持一致,但为了让观众看得舒服,通常需要调整断句,也可以适当清理无意义的语气词。

准备好试听你的脚本了吗?

几分钟内生成自然的 AI 配音。

免费生成你的第一段配音

继续阅读