那场演讲在讲什么?面向科学演示的视频转文本摘要数据集
计算与语言
2025-05-27 v4 人工智能
计算机视觉与模式识别
摘要
将录制的视频转化为简洁且准确的文本摘要是多模态学习中日益增长的挑战。本文介绍了 VISTA,一个专门面向科学领域视频转文本摘要的数据集。VISTA 包含 18,599 段录制的 AI 会议演示及其对应的论文摘要。我们对最先进的通用大模型的性能进行了基准测试,并应用基于计划的框架以更好地捕捉摘要的结构化特性。人工评估和自动评估均表明,显式的规划能够提升摘要质量和事实一致性。然而,模型性能与人工表现之间仍存在相当大的差距,凸显了本数据集的挑战性。本研究旨在为科学领域的视频转文本摘要未来研究铺平道路。
引用
@article{arxiv.2502.08279,
title = {What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations},
author = {Dongqi Liu and Chenxi Whitehouse and Xi Yu and Louis Mahon and Rohit Saxena and Zheng Zhao and Yifu Qiu and Mirella Lapata and Vera Demberg},
journal= {arXiv preprint arXiv:2502.08279},
year = {2025}
}
备注
ACL 2025 Main & Long Conference Paper