面向印度语言视觉引导电影字幕翻译的探索研究
计算与语言
2026-05-13 v1
摘要
电影字幕翻译本质上是多模态任务,然而仅凭文本的系统往往无法捕获传递情感、动作及社交细微差别所需的视觉线索,尤其是针对资源较少的印度语言(如英语至印地语、孟加拉语、泰卢固语、泰米尔语和卡纳达语)。我们进行了一个案例研究,分析了五部长篇电影,并比较了两种轻量级视觉对齐策略:基于5分钟滑动窗口的结构化属性摘要与电影字幕视觉间隙的自由文本摘要。我们的分析表明,长篇视频中字幕与画面之间的时间错位是一个主要障碍,常常使不加筛选的视觉对齐方法失效。然而,通过替换基线方案中最差的20-30%的片段,采用选择性视觉对齐(oracle selective grounding),在COMET指标上均能稳定显著提升,同时所需的视觉处理资源远小于基线方案。两种方法中,基于粗糙属性的视觉上下文摘要更为稳健,能够捕捉到场景层面的情感与语境细微线索,这些线索是文本alone难以捕获的。
引用
@article{arxiv.2605.11993,
title = {Towards Visually-Guided Movie Subtitle Translation for Indic Languages},
author = {Tarun Chintada and Kshetrimayum Boynao Singh and Asif Ekbal},
journal= {arXiv preprint arXiv:2605.11993},
year = {2026}
}