中文

表征多模态长文本摘要:以财务报告为例

计算与语言 2024-08-16 v3 人工智能 机器学习

摘要

随着大语言模型(LLMs)扩展自然语言处理处理长输入的能力,需要进行严格和系统的分析以理解其能力和行为。一个突出的应用是摘要生成,因其普遍性和争议性(例如,研究人员已宣布摘要生成的死亡)。本文以财务报告摘要生成为案例研究,因为财务报告不仅长,而且大量使用数字和表格。我们提出了一个用于表征多模态长文本摘要的计算框架,并研究了Claude 2.0/2.1、GPT-4/3.5和Cohere的行为。我们发现GPT-3.5和Cohere无法有意义地执行此摘要任务。对于Claude 2和GPT-4,我们分析了摘要的提取性,并识别出LLMs中的位置偏差。在打乱Claude的输入后,这种位置偏差消失,这表明Claude似乎能识别重要信息。我们还对LLM生成摘要中数字数据的使用进行了全面调查,并提供了数字幻觉的分类。我们采用提示工程来改进GPT-4对数字的使用,但效果有限。总体而言,我们的分析突显了Claude 2在处理长多模态输入方面相比GPT-4的强大能力。生成的摘要和评估代码可在https://github.com/ChicagoHAI/characterizing-multimodal-long-form-summarization获取。

关键词

引用

@article{arxiv.2404.06162,
  title  = {Characterizing Multimodal Long-form Summarization: A Case Study on Financial Reports},
  author = {Tianyu Cao and Natraj Raman and Danial Dervovic and Chenhao Tan},
  journal= {arXiv preprint arXiv:2404.06162},
  year   = {2024}
}