中文

MAVL:面向动画歌曲翻译的多语言音视频歌词数据集

计算与语言 2025-09-19 v4 机器学习 多媒体 声音 音频与语音处理

摘要

歌词翻译要求实现准确的语义传递,同时保留音乐节奏、音节结构与诗意风格。在动画音乐剧中,这一挑战因需与视觉听觉线索对齐而更为复杂。我们介绍了面向动画歌曲翻译的多语言音视频歌词基准数据集(Multilingual Audio-Video Lyrics Benchmark for Animated Song Translation, MAVL),这是第一个多语言、多模态的可唱歌词翻译基准。通过融合文本、音频与视频,MAVL实现了超越文本单一方法的更丰富、更具表达力的翻译。基于此,我们提出了基于链式思维的音视频大语言模型Syllable-Constrained Audio-Video LLM(SylAVL-CoT),该模型利用音视频线索并强制执行音节约束,生成更自然的歌词。实验结果表明,SylAVL-CoT在可唱性和情境准确性方面显著优于文本基模型,凸显了多模态、多语言方法在歌词翻译中的价值。

关键词

引用

@article{arxiv.2505.18614,
  title  = {MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song Translation},
  author = {Woohyun Cho and Youngmin Kim and Sunghyun Lee and Youngjae Yu},
  journal= {arXiv preprint arXiv:2505.18614},
  year   = {2025}
}

备注

Accepted to EMNLP 2025, Project Page: https://k1064190.github.io/papers/paper1.html, our codes and datasets are available at https://github.com/k1064190/MAVL