中文

基于细粒度视频配音时长对齐的分段监督偏好优化

声音 2025-08-13 v1 计算与语言

摘要

视频配音旨在将视觉媒体节目中的原语音从源语言翻译成目标语言,依赖于神经机器翻译和文本转语音技术。由于不同语言之间信息密度的差异,目标语音的时长往往与源语音不匹配,导致音视频同步问题,这显著影响观众体验。本研究将基于大语言模型的视频配音机器翻译中的时长对齐问题视为一种偏好优化问题。我们提出了一种分段监督偏好优化(Segment Supervised Preference Optimization, SSPO)方法,采用分段抽样策略和细粒度损失,以缓解源文本与目标文本之间的时长不匹配。实验结果表明,SSPO 在时长对齐任务上取得了优异的性能。

关键词

引用

@article{arxiv.2508.08550,
  title  = {Fine-grained Video Dubbing Duration Alignment with Segment Supervised Preference Optimization},
  author = {Chaoqun Cui and Liangbin Huang and Shijing Wang and Zhe Tong and Zhaolong Huang and Xiao Zeng and Xiaofeng Liu},
  journal= {arXiv preprint arXiv:2508.08550},
  year   = {2025}
}

备注

This paper is accepted by ACL2025 (Main)