超越瞬间:面向连贯音频描述序列
计算机视觉与模式识别
2025-10-30 v1 计算与语言
摘要
音频描述(ADs)传递关键的屏幕信息,使视力受损者能够跟随视频。为了有效,ADs 必须形成连贯的序列,帮助听众想象正在展开的情景,而不是对孤立的时刻进行描述。然而,大多数自动方法会独立地生成每个 AD,常常导致重复、连贯性差的描述。为此,我们提出一种无训练方法 CoherentAD,首先为每个 AD 时间间隔生成多个备选描述,然后在序列中进行自回归选择,以形成连贯且信息丰富的叙事。为全面评估 AD 序列,我们引入一种序列级指标 StoryRecall,用于衡量预测的 ADs 传递真实叙事的程度,同时还有捕捉连续 AD 输出冗余的重复指标。我们的方法生成连贯的 AD 序列,增强了叙事理解,优于依赖独立生成的先前方法。
引用
@article{arxiv.2510.25440,
title = {More than a Moment: Towards Coherent Sequences of Audio Descriptions},
author = {Eshika Khandelwal and Junyu Xie and Tengda Han and Max Bain and Arsha Nagrani and Andrew Zisserman and Gül Varol and Makarand Tapaswi},
journal= {arXiv preprint arXiv:2510.25440},
year = {2025}
}