文档 · DaVinci Resolve 工具

声转字幕使用指南

附实机截图与 GIF:原生字幕后台回填、Word/TXT/飞书参考文稿、中文词组断句、16/10 字设置、离线转写与词库。

下载与安装

下载 macOS Apple Silicon 测试版 0.3.9(ZIP)

声转字幕把达芬奇时间线上的音频转换为 SRT,支持框选片段和整条音轨、私网和云端服务,以及下载后可离线使用的本机模型。

本页图片与 GIF 均为 macOS 实机录制,使用专用测试项目和合成语音。参考文稿、后台回填和长度设置录于 0.3.0;框选、词库、离线模型等沿用 0.2.0 的操作演示。GIF 适当加速;MP4 可暂停或减速跟随。

下载新版操作录屏(参考文稿与长度设置,2 段 MP4)

下载基础操作录屏(选择、导出、词库、模型等 7 段 MP4)

当前版本面向 Apple Silicon Mac,要求 macOS 14 或更新版本、DaVinci Resolve Studio 20。开发验收版本为 Resolve Studio 20.3.2。应用自带 Python 和 FFmpeg;规则校对、本机转写不依赖 Codex。

  1. 解压安装包,把“声转字幕.app”放进“应用程序”或固定文件夹。
  2. 双击打开。预览版尚未经过 Apple Developer ID 公证;如 macOS 拦截,请在“系统设置 → 隐私与安全性”按系统提示允许打开。
  3. 打开 Resolve Studio,在偏好设置中把“外部脚本使用”设为“本地”,打开项目和时间线。
  4. 在“系统设置 → 隐私与安全性 → 辅助功能”添加并允许“声转字幕”。只有时间线框选需要这个权限;整轨读取、转写、原生 ST 字幕回填和 SRT 导出均可后台完成。
  5. 如需从达芬奇菜单打开,运行安装包中的“安装达芬奇菜单.command”,重启达芬奇后,从“工作区 → 脚本 → 声转字幕”打开面板。

0.3.0 新增参考文稿与中文语序断句,长度默认 16,并注明短视频建议 10。字幕直接写入原生 ST 轨道;继续保留私网连接修复。

这是独立的 macOS 浮动面板,通过 Resolve 脚本接口工作,当前不支持停靠进 Resolve 工作区。关闭窗口后可从 Dock 或菜单重新打开。

选择音频与生成

主页面提供两种选择方式。下面先看面板切换,再跟着完成一次框选转写。

  1. 在“选择方式”中切换“时间线框选”或“整条音轨”。
  2. 使用整轨模式时,在右侧选择 A1、A2 等音轨。
  3. 核对下面的音频位置和时长,再点击生成或导出。
面板实录:切换框选与整轨,选择 A2 并核对片段列表
  • 时间线框选:在剪辑页框选需要转写的音频,再点“生成字幕”。没有选到音频时提示“请选择时间线上需要转写的音频。”。
  • 整条音轨:在面板选择 A1、A2 等轨道。插件读取该轨道上全部启用的音频片段,保留剪辑位置和片段之间的空隙。静音轨道会提示重新选择。

框选操作:先点时间线空白处取消旧选区,再拖出选框包住目标音频。下图实际选中了 A1 的一段对白。

达芬奇实录:在时间线上框选 A1 音频

回到面板点击“生成字幕”,等待进度完成。插件在后台执行转写和校对,生成 SRT 并直接写入当前时间线的原生 ST 字幕轨道。整轨模式全程无需切换前台窗口;下方“参考文稿”录屏展示了新版的生成过程。

“生成字幕”完成后会新建字幕轨道,并核对每条字幕的文字与起止帧。“导出字幕”会先让你选外部文件位置,完成后保存 SRT,不修改时间线。默认外部导出的时间码相对于当前时间线起点;可以在设置中选择从第一段音频归零。

回填后的实际界面:字幕预览与音频位置对齐;新字幕在独立轨道上,可以继续修改文字、字体和样式。

达芬奇实际截图:新字幕轨道与音频位置对齐

只要外部 SRT 时,点击“导出字幕”,输入文件名并选择文件夹,再确认导出。下图从选择目录开始,录到了转写进度和导出完成提示。

实机录屏:选择外部保存目录并导出 SRT

任务中显示阶段和已完成进度。模型处理单个片段时没有可信的内部百分比,面板会显示正在处理;百分比按完成的音频量累计。取消后本机任务会结束;已经提交的服务器任务可能继续运行,任务编号会保留。

进度示例:当前片段仍在处理时,会显示阶段名称;完成后再累计百分比。

进度条实际截图:本机 Qwen 转写当前片段

生成期间请勿切换项目或移动所选音频。回填通过 Resolve 脚本接口直接写入当前时间线的新原生 ST 字幕轨,逐条核对文字与时间码,并恢复播放头和轨道锁定状态;旧字幕轨道内容保留。回填不创建临时时间线、不操作复制粘贴,也不激活前台窗口。框选识别仍会短暂切换到达芬奇,切换片段启用状态再恢复;选择整条音轨可省去这一步。操作会增加撤销历史。意外中断时回到原项目,在设置中点“恢复未完成的操作”。

参考文稿与对照校对

转写页的“参考文稿”支持直接粘贴正文、上传 Word(DOCX / DOC)、TXT、Markdown、RTF,以及读取飞书文档或知识库链接。文件最大 20 MB,正文最多 50,000 字;UTF-8、UTF-16 和常见 GB18030 TXT 编码可读取。Word 保留可见正文,排除修订中删除的文字。

上传或读取后可以编辑正文,点击“使用文稿”保存。参考文稿按项目和时间线单独保存,可在主页面临时停用;切换时间线不会沿用上一条时间线的稿件。文件导入只读取正文,不上传文件到转写服务器。

飞书组件随应用安装,不需要 Codex 或 Node.js。第一次使用,在参考文稿窗口的飞书区域点击“首次配置”,按官方 CLI 向导完成飞书应用配置;已有 CLI 配置可以复用。点击“登录授权”,完成浏览器中的文档与知识库读取授权,再点“授权完成,检查”。随后粘贴 /docx/ 或 /wiki/ 文档链接,点击“读取文稿”。不会修改飞书原文。设置里可以指定自己的飞书 CLI 路径。

文稿中提取的英文专名和引号内词条会用于离线模型的识别提示;所有转写服务都执行本机规则比对。相邻上下文能对齐的短同音错字和英文大小写可以修正,时间码保持原样。数字、否定词、增删句、不同音词或有歧义的内容保留识别结果并提示核对。文稿里没有读出的开场、结尾和说明不会强制补入字幕。生成后点击“查看文稿与字幕校对记录”,查看修改前后文字、所在秒数及待核对差异。

开启 Codex 二次校对时,启用的参考文稿也会作为文字数据发送给 Codex。仅使用规则校对不需要 Codex,上传本地文稿也不需要飞书登录。

操作顺序:点“粘贴 / 编辑”或“上传文件”→核对正文→“使用文稿”→勾选启用→“生成字幕”→“查看文稿与字幕校对记录”。飞书连接也在同一窗口,首次需完成配置和登录。

0.3.0 实机录屏:编辑参考文稿、查看飞书入口、保存并后台生成字幕

录屏使用已有转写缓存,处理较快;真实长音频会显示阶段和累计进度。录屏中的参考文稿与音频有两处差异,规则保留识别内容并提示核对,没有用文稿强行补句。

转写服务

  • 5090 优先,云端备用:先访问配置的私网服务;连接不可用时调用选定云服务。已收到服务器任务编号后不会自动重复提交云端。
  • 仅 5090 私有服务:需要能访问该服务的局域网或私网连接。
  • 仅云端 API:直接使用阿里云百炼或火山引擎豆包语音。
  • 本机离线模型:使用已经下载到 Mac 的模型,不发送音频到服务器。

5090 地址需填写自己可访问的服务地址;发布包不携带团队私网地址。服务应提供 /health、/v1/audio/transcriptions 和 /v1/jobs/{id},返回带时间戳的 units。

百炼使用北京地域 Fun-ASR-Realtime HTTP 转写接口,可填写业务空间专属地址、模型名和 API Key。火山引擎使用“大模型录音文件识别极速版”接口,支持新版 API Key 或旧版 APP ID + Access Token,默认资源 ID 为 volc.bigasr.auc_turbo。两家的凭据均留空,由用户填写,保存在 macOS 钥匙串中。云端模式及自动备用会向选定服务发送所选音频,并产生相应服务用量。

设置修改后点击“保存设置”。主页面的选择方式和音轨选择立即生效。

规则校对与词库

规则校对默认开启,参考提供的中文字幕规范实现:中英文及数字间距、行尾标点处理、保留问号和感叹号、清理独立的“嗯、呃、额”等犹豫音、保护已确认的专名和数字单位、按标点和真实停顿断句。设置中的“每条字幕最大文字长度”默认 16,旁边注明“常规建议 16,短视频建议 10”,可以自行修改。汉字、字母、数字和标点各计 1,不计空格。已保存的自定义设置会保留。语义完整和真实时间戳优先;无法可靠拆分的长词、句尾疑似不完整及显示过短会提示检查。

规则不会把“那个、然后”等可能有实际含义的词一律删除,也不会推断听不清的语音或改写整句。原音频内容仍需最终试听核对。

长度上限用于选择断句位置,不会截掉超出的文字。内置中文词典分词和词性规则,先保护词库专名、完整词语和数字单位,再结合标点、停顿和长度选择边界。例如 10 字模式下,“生成的字幕需要和时间线准确对齐”会拆为“生成的字幕需要”/“和时间线准确对齐”,保留“时间线”这个词。

“的、地、得”与前后词组相连,语气和时态助词跟随前句;“把、在、和、但是、所以”等与后文相连,避免虚词悬在句首或句尾。动词与短宾语、修饰语与中心词会优先放在一起。断句只使用转写服务已有的时间边界;遇到不能安全拆分的长专名或整句时间码,允许超过设置值并在校对记录中提示。规则能减少机械断句,不能保证所有口语的语法分析都正确。

打开“设置 → 转写服务”,向下找到“每条字幕最大文字长度”。常规使用 16,短视频可改为 10,点“保存设置”生效。

0.3.0 实机录屏:将单条字幕长度从 16 改为 10 并保存

在“词库”中新增正确词条,可填写常见误识别写法,多个写法以 | 分隔。例如正确词条“乾崑智驾”,误识别写法“乾坤智驾”。保存后用于下次转写结果纠错与断句保护。Qwen 本机模型还会把已确认词条作为识别上下文;其他接口是否支持转写前热词取决于服务,本版统一在转写后应用词库。

词库操作按下面三步完成:

  1. 点“添加词条”,输入确认过的正确名称。
  2. 在右侧填写误识别写法,多个写法用 | 分隔。
  3. 点“保存词库”,看到保存成功提示后,下次转写生效。录屏以“乾崑智驾 / 乾坤智驾”为例。
实机录屏:添加正确词条与误识别写法并保存

自动收集会把新英文词、缩写加入候选区;候选词须人工采用并保存才会生效。你在达芬奇中修正上次生成的字幕后,点“读取时间线修订”,插件会提取可辨认的修改词对作为候选,供确认。词库可编辑、停用、删除、导入和导出 JSON;不会自动上传词库。

可选 Codex 校对

在“设置 → 规范与 Codex”中开启。需要另行安装并登录 Codex CLI;可自动检测或填写 CLI 路径。检测后可选择本机缓存中的模型和对应思考程度,也可手动填写模型 ID。可用模型与额度以你的账户为准。

操作顺序:勾选“开启 Codex 二次校对”→“检测并读取模型”→选择模型→选择思考程度→“保存设置”。录屏中的模型列表来自演示账户,本机实际列表可能不同。

实机录屏:开启可选 Codex 校对,选择模型与思考程度

开启后发送字幕文字、已确认词条和启用的参考文稿,由 Codex 做进一步文字校对。程序校验条目数量、编号、数字与修改幅度,保留时间码。返回异常、登录失败、超时或校验未通过时保留规则版,并在面板显示原因。离线使用请关闭此选项。

本机离线转写

打开“设置 → 离线模型”,选择保存目录并点“下载并安装”。首次需要联网下载 Python 依赖和官方模型;以后可以断网使用。

  • FunASR Paraformer:面向中文与常见英文词,使用 CPU,模型约 1 GB。
  • Qwen3-ASR 0.6B:配套下载 Qwen3-ForcedAligner-0.6B 生成时间戳,模型合计约 3 GB。CPU 为兼容模式;Apple GPU 作为实验选项,实际表现取决于芯片、内存和运行库。

首次使用时,在对应模型卡片点“下载并安装”,等状态变成“已安装”。已有模型时,该按钮显示“校验 / 补全下载”。下面录制的是模型已安装后的配置:先关闭 Codex 在线校对,再选择 Qwen、CPU 兼容模式,点“设为本机离线转写”,最后回到首页确认“本机离线”状态。

实机录屏:在已安装的 FunASR 与 Qwen 模型之间切换并启用离线转写

下载完成后点“设为本机离线转写”。本机模型按 30 秒分段处理,内存占用与性能取决于模型。下载可以取消并重新点击补全。模型和运行库放在应用之外,更新应用时会保留。

检查更新与恢复

右下角“检查更新”访问 声转字幕使用指南 配套的版本接口。打开面板时默认检查,空闲且词库编辑已保存时自动下载并安装新版本。设置中可以关闭自动检查或自动安装。

更新清单使用 Ed25519 签名,下载包校验 SHA-256、应用标识和版本号。新包验证通过后才替换应用,并保留上一版。转写进行中会推迟安装。预览版更新后如果 macOS 要求重新授权辅助功能,请按系统提示重新添加应用。

文件与当前限制

本地数据位于 ~/Library/Application Support/Resolve Subtitle/。每次任务保存原始结果、rules-only.srt、最终 subtitles.srt 和 proofreading.json。API 凭据单独保存在钥匙串。任务缓存和音频可能占用磁盘,可在任务结束后自行清理旧任务与缓存;请先保存需要的结果。

当前按原始素材的剪辑范围和声道映射提取音频,不包含时间线混音、音量自动化和音频效果。不支持复合片段、倒放、变速或同时重叠的对白;遇到这些情况,请先把对白渲染成 WAV 放回时间线再转写。23.976/29.97 等帧率有转换逻辑,仍建议首次在测试时间线检查对齐。

阿里云、火山引擎的适配按官方协议实现,凭据留空;使用前需填入自己的已开通服务凭据。本版不承诺自动转写能替代人工听审。