你看到的即你要问的:评估音频描述
计算机视觉与模式识别
2025-10-02 v1 人工智能
计算与语言
摘要
音频描述(AD)为盲人和低视力人群叙述电影中重要的视觉细节,帮助他们理解情节并欣赏视觉细节。现有的自动AD生成方法大多 focus 在几秒的剪辑片段上,并通过与单一参考AD的比较来进行评估。然而,撰写AD本身具有主观性。通过对同一部电影的两个独立AD轨迹进行对齐和分析,我们量化了在何时、是否描述以及描述什么内容以及如何突出显示方面的主观性。因此,我们表明仅使用剪辑片段是不够的。我们提出了ADQA,这是一个QA基准,旨在对几分钟长、连贯的视频片段进行AD评估,测试它们是否帮助盲人和低视力人群理解故事并欣赏视觉细节。ADQA包含关于视觉事实的视觉欣赏(VA)问题以及基于情节的叙事理解(NU)问题。通过ADQA,我们表明当前的AD生成方法远远落后于人类编写的AD。我们随后提出了几项针对未来工作的建议,并引入了一个公开排行榜用于基准测试。
引用
@article{arxiv.2510.00808,
title = {What You See is What You Ask: Evaluating Audio Descriptions},
author = {Divy Kala and Eshika Khandelwal and Makarand Tapaswi},
journal= {arXiv preprint arXiv:2510.00808},
year = {2025}
}
备注
EMNLP 2025 Main Track Long Paper