WorkBuddy 实践案例

音视频跨语言译制:中文口播视频一键转英文配音 + 对齐字幕

WorkBuddy 通过 MCP 调用外部腾讯云 MPS(媒体处理)服务的 Skill,编排「AI 声纹克隆配音 → 语音识别 → 字幕对齐」的云端流水线,并结合本地 Agent 的 FFmpeg 能力完成字幕烧录,端到端产出一条可直接投放的英文版营销短视频。

MCP 工具调用 腾讯云 MPS Skill AI 声纹克隆 跨语言译制 本地 FFmpeg 编排 Agent 云边协同

最终效果对比

转换前 · 中文原片
语音 中文口播字幕 仅画面原生中文时长 55s · 720×960
转换后 · 英文配音版
语音 AI 克隆原声·英文配音字幕 英文·与配音逐句对齐时长 55s · 720×960
核心亮点:英文配音由 MPS AI 克隆原说话人音色生成,音色接近原人;英文字幕并非从中文翻译而来,而是从配音成品反向语音识别得到,因此与配音内容逐字一致、时间轴精准贴合。字幕置于画面底部,与原生中文标题上下错开、互不遮挡。
1

案例场景描述

某教育硬件厂商(讯飞 AI 英语宝 Pro)有一条中文口播营销短视频,需要面向海外市场发布英文版本。传统做法需要人工听译、录音棚重新配音、字幕组制作与压制,周期以「天」计、成本高。

诉求可拆解为三个明确目标:

去中文、换英文配音保留原说话人音色特征,让英文版听起来仍是"同一个人"在讲。
配英文字幕字幕内容必须与英文配音完全一致,不能是另一套翻译。
字幕位置不冲突画面已有原生中文标题,英文字幕需错开,置于底部不遮挡主体。
端到端自动化由 Agent 自主编排云端与本地能力,人工只需决策与确认。

能力编排架构

WorkBuddy Agent意图理解·任务编排
MCP 调用腾讯云 MPS Skill
腾讯云 MPS克隆配音·ASR·翻译
本地能力COS 收发·FFmpeg 烧录
成品视频英配+对齐字幕
分工逻辑:专业音视频 AI 算力(声纹克隆、语音识别、机器翻译)下沉到腾讯云 MPS,通过 MCP Skill 以标准命令调用;确定性、轻量的字幕合成(FFmpeg 烧录、位置控制)由本地 Agent 完成。云端负责"智能",本地负责"精确",各司其职。
2

前置准备

A
安装 MPS 相关 Skill通用媒体处理 tencent-mps(转码/字幕/COS 等)与一站式译制 tencent-mps-video-dubbing。安装前经过安全审计(无危险调用、无外发、企业认证发布者)。
B
配置腾讯云凭证~/.env 写入 SecretId/SecretKey、API 地域、COS 桶与地域。密钥由用户自行配置,Agent 不代为索取。
C
安装 Python 依赖tencentcloud-sdk-pythoncos-python-sdk-v5python-dotenv,隔离安装在托管运行时中,不污染系统环境。
D
准备本地 FFmpeg本机无 Homebrew,Agent 自动下载 arm64 静态版 FFmpeg(含 libass 字幕支持)到项目 tools/ 目录,即用即走。
3

关键执行流程

1

上传原视频至对象存储MCP · MPS Skill

调用 mps_cos_upload.py 将本地 MP4 上传到腾讯云 COS,作为 MPS 云端处理的输入源。

2

一站式跨语言译制(核心)MCP · MPS Skill

调用 mps_video_dubbing.py(ASR 模式,zh→en,不压字幕)。MPS 单任务内完成「中文语音识别 → 机器翻译 → AI 克隆原声英文配音」,产出仅换配音、画面不动的英文视频。约 8.5 分钟。

3

对配音成品反向语音识别MCP · MPS Skill

关键一步:对英文配音视频本身调用 mps_subtitle.py(英文 ASR)生成 SRT。字幕即配音的逐字转写,从根本上保证"字幕=配音",避免两套独立翻译措辞不一致的问题。

4

本地烧录字幕到画面底部本地 · FFmpeg

Agent 用本地 FFmpeg 将对齐后的英文 SRT 硬压到画面底部(Alignment=2),精确控制位置避开原生中文标题,音轨直接复制不重编码。

5

截帧自检并交付本地 · Agent

抽取成品关键帧核对字幕位置与内容一致性,确认无重叠、逐句对齐后交付最终成片。

4

提示词的编写

整个流程由多轮自然语言对话驱动,无需用户懂命令行。关键提示词按"目标 → 确认 → 迭代修正"逐步收敛:

用户与 WorkBuddy 的关键对话
# 初始需求(说清目标与素材,不必指定工具)
我这里有一个 mp4 文件,想利用腾讯云 VOD/MPS 的配音和翻译能力,
去掉中文、翻译成英文配音,并加上英文字幕,该如何做?

# 提供素材路径
文件在这里:/path/讯飞英语宝PRO.mp4

# 确认执行(Agent 已复述方案与费用后)
A,确认提交

# 迭代修正 1:字幕位置
英文字幕在竖屏正中间挡住画面了,放到最下面,
跟既有的中文字幕不冲突

# 迭代修正 2:字幕与配音对齐(本案例最关键的一次纠偏)
英文字幕和视频克隆的英文不完全一致,
请用音色克隆后的视频重新翻译好英文字幕,再烧制
提示词要点:① 说清「输入素材 + 目标产物」即可,无需指定具体 API;② 涉及费用/不可逆操作时 Agent 会复述并等待确认(如 A,确认提交);③ 对结果不满意时用自然语言描述问题,Agent 自行诊断根因并调整技术方案(如从"翻译字幕"改为"对配音反向识别字幕")。
5

预期输出内容

英文配音成片 —— 一条完整 MP4:AI 克隆原声的英文配音 + 底部英文字幕 + 保留原画面(讯飞英语宝PRO_英文配音_对齐字幕.mp4)。
中间产物·英文配音视频 —— MPS 译制直出、未加字幕的英文配音版,可用于二次编辑。
对齐字幕文件 —— 从配音反向识别的英文 SRT,可外挂或再压制。
过程可追溯 —— 每个云端任务均返回 TaskId,费用透明、可查询、不重复计费。
能力沉淀 —— 执行中发现并修复了 Skill 的环境加载缺陷,经验写入记忆,下次同类任务更顺畅。

案例价值

效率传统人工听译+配音+字幕以天计,此方案端到端约十余分钟,一句话触发。
质量AI 克隆原声保持音色一致性;字幕反向识别保证字音逐句对齐。
能力融合MCP 打通外部专业云服务,本地能力补足精确控制,云边协同。
可控费用前置确认、结果截帧自检、问题自主纠偏,全程可追溯。