中文

Attend to what I say: 为演示文稿突出显示相关内容

计算机视觉与模式识别 2026-01-16 v1

摘要

想象坐在一次演示中,同时试图跟随演讲者的同时扫描幻灯片以获取相关信息。虽然整个幻灯片都可见,但识别相关区域可能很具挑战性。当你聚焦于幻灯片的一个部分时,演讲者会转向新的句子,导致你在视觉上匆忙赶上。这导致了演讲内容与最重要的视觉元素之间的持续来回切换,使得难以吸收关键细节,尤其是在快速或内容密集的演示中,如会议演讲。需要理解幻灯片的内容,包括文本、图形和布局。我们引入一种方法,自动识别并突出显示基于演讲者叙述所需的最相关幻灯片区域。通过分析 spoken content(口头内容)并将其与幻灯片中的文本或图形元素匹配,我们的方法确保听众听到的内容与其需要关注的视觉内容之间的更好同步。我们探索了解决此问题的不同方法并评估其成功与失败案例。分析多媒体文档正成为一种关键要求,用于无缝理解内容丰富的视频,如教育视频和会议演讲,通过减少认知负担并提高理解。代码和数据集均可在:https://github.com/meghamariamkm2002/Slide_Highlight 获取。

关键词

引用

@article{arxiv.2601.10244,
  title  = {Attend to what I say: Highlighting relevant content on slides},
  author = {Megha Mariam K M and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2601.10244},
  year   = {2026}
}

备注

Accepted at the International Conference on Document Analysis and Recognition (ICDAR) 2025