在超复数空间融合多模态信号以实现科学内容的极端抽取式文本摘要(TL;DR)
计算与语言
2023-06-27 v1 人工智能
摘要
得益于带标注的简短摘要和充足数据,科学文本摘要领域取得了显著进展。然而,视频和音频等多种输入模态的利用尚待深入探索。目前,基于科学多模态输入的文本摘要系统倾向于采用如摘要等较长的目标摘要,导致在文本摘要任务上表现不佳。本文处理一项利用多输入模态的极端抽取式文本摘要(即TL;DR生成)新任务。为此,我们引入mTLDR,一个上述任务的首个同类数据集,包含视频、音频和文本,以及作者撰写摘要和专家标注摘要。mTLDR数据集附带从ICLR、ACL和CVPR等各类学术会议论文集收集的共计4,182个实例。随后,我们提出mTLDRgen,一种基于编码器-解码器的模型,采用新颖的双融合超复数Transformer结合Wasserstein黎曼编码器Transformer,以在超复数潜几何空间中灵巧捕捉不同模态间的复杂性。超复数Transformer捕捉模态间内在属性,而Wasserstein黎曼编码器Transformer捕捉潜空间几何中模态的潜结构,从而使模型生成多样化句子。mTLDRgen在mTLDR及另一非科学数据集(How2)上,基于三项基于Rouge的评估指标优于20个基线。此外,基于定性指标BERTScore和FEQA以及人工评估,我们证明mTLDRgen生成的摘要流畅且与原始素材一致。
引用
@article{arxiv.2306.13968,
title = {Fusing Multimodal Signals on Hyper-complex Space for Extreme Abstractive Text Summarization (TL;DR) of Scientific Contents},
author = {Yash Kumar Atri and Vikram Goyal and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2306.13968},
year = {2023}
}
备注
Accepted to ADS-SIGKDD2023