WorkBuddy 通过 MCP 调用外部腾讯云 MPS(媒体处理)服务的 Skill,编排「AI 声纹克隆配音 → 语音识别 → 字幕对齐」的云端流水线,并结合本地 Agent 的 FFmpeg 能力完成字幕烧录,端到端产出一条可直接投放的英文版营销短视频。
某教育硬件厂商(讯飞 AI 英语宝 Pro)有一条中文口播营销短视频,需要面向海外市场发布英文版本。传统做法需要人工听译、录音棚重新配音、字幕组制作与压制,周期以「天」计、成本高。
诉求可拆解为三个明确目标:
tencent-mps(转码/字幕/COS 等)与一站式译制 tencent-mps-video-dubbing。安装前经过安全审计(无危险调用、无外发、企业认证发布者)。~/.env 写入 SecretId/SecretKey、API 地域、COS 桶与地域。密钥由用户自行配置,Agent 不代为索取。tencentcloud-sdk-python、cos-python-sdk-v5、python-dotenv,隔离安装在托管运行时中,不污染系统环境。tools/ 目录,即用即走。调用 mps_cos_upload.py 将本地 MP4 上传到腾讯云 COS,作为 MPS 云端处理的输入源。
调用 mps_video_dubbing.py(ASR 模式,zh→en,不压字幕)。MPS 单任务内完成「中文语音识别 → 机器翻译 → AI 克隆原声英文配音」,产出仅换配音、画面不动的英文视频。约 8.5 分钟。
关键一步:对英文配音视频本身调用 mps_subtitle.py(英文 ASR)生成 SRT。字幕即配音的逐字转写,从根本上保证"字幕=配音",避免两套独立翻译措辞不一致的问题。
Agent 用本地 FFmpeg 将对齐后的英文 SRT 硬压到画面底部(Alignment=2),精确控制位置避开原生中文标题,音轨直接复制不重编码。
抽取成品关键帧核对字幕位置与内容一致性,确认无重叠、逐句对齐后交付最终成片。
整个流程由多轮自然语言对话驱动,无需用户懂命令行。关键提示词按"目标 → 确认 → 迭代修正"逐步收敛:
# 初始需求(说清目标与素材,不必指定工具) 我这里有一个 mp4 文件,想利用腾讯云 VOD/MPS 的配音和翻译能力, 去掉中文、翻译成英文配音,并加上英文字幕,该如何做? # 提供素材路径 文件在这里:/path/讯飞英语宝PRO.mp4 # 确认执行(Agent 已复述方案与费用后) A,确认提交 # 迭代修正 1:字幕位置 英文字幕在竖屏正中间挡住画面了,放到最下面, 跟既有的中文字幕不冲突 # 迭代修正 2:字幕与配音对齐(本案例最关键的一次纠偏) 英文字幕和视频克隆的英文不完全一致, 请用音色克隆后的视频重新翻译好英文字幕,再烧制
A,确认提交);③ 对结果不满意时用自然语言描述问题,Agent 自行诊断根因并调整技术方案(如从"翻译字幕"改为"对配音反向识别字幕")。讯飞英语宝PRO_英文配音_对齐字幕.mp4)。SRT,可外挂或再压制。