用于长视频到文本摘要的分层3D适配器
计算与语言
2022-10-11 v1
摘要
本文关注视频到文本摘要,并研究如何最好地利用多模态信息将长输入(例如一小时的电视节目)摘要为长输出(例如多句摘要)。我们扩展了SummScreen(Chen et al., 2021),一个由带参考摘要的电视剧集转录文本组成的对话摘要数据集,并通过收集相应的完整长度视频创建了多模态变体。我们使用带有分层结构增强的适配器模块将多模态信息高效地融入预训练文本摘要器,同时仅调优3.8%的模型参数。我们的实验表明,多模态信息相较更耗费内存且全量微调的文本摘要方法具有更优性能。
引用
@article{arxiv.2210.04829,
title = {Hierarchical3D Adapters for Long Video-to-text Summarization},
author = {Pinelopi Papalampidi and Mirella Lapata},
journal= {arXiv preprint arXiv:2210.04829},
year = {2022}
}