一种电视节目多模态摘要的模块化方法
计算与语言
2024-08-23 v9
摘要
本文解决了电视节目摘要任务,该任务触及人工智能研究的关键领域:复杂推理、多模态和长叙事。我们提出了一种模块化方法,其中独立的组件执行专门的子任务,我们认为这与端到端方法相比提供了更大的灵活性。我们的模块包括检测场景边界、重新排序场景以最小化不同事件之间的剪辑次数、将视觉信息转换为文本、总结每个场景中的对话,以及将场景摘要融合为整个剧集的最终摘要。我们还提出了一种新指标 PRISMA(摘要事实的精确率与召回率评估),用于衡量生成摘要的精确率和召回率,我们将摘要分解为原子事实。在最近发布的 SummScreen3D 数据集上进行的测试表明,与对比模型相比,我们的方法通过 ROUGE 和我们新的基于事实的指标衡量,并经人工评估者评估,产生了更高质量的摘要。
引用
@article{arxiv.2403.03823,
title = {A Modular Approach for Multimodal Summarization of TV Shows},
author = {Louis Mahon and Mirella Lapata},
journal= {arXiv preprint arXiv:2403.03823},
year = {2024}
}