中文

cPAPERS:面向科学论文中情境化和多模态交互式对话的数据集

计算与语言 2024-06-13 v1 人工智能 机器学习

摘要

情境化和多模态交互式对话(SIMMC)中的一种新兴研究领域包括科学论文中的交互。由于科学论文主要由文本、方程、图形和表格组成,SIMMC 方法必须针对每个组成部分进行开发,以支持研究科学家所需的深入查询和交互。本工作引入了对话论文(cPAPERS),这是一个来自 arXiv 上可用科学文档评论中的对话问答对数据集,这些问答对以这些论文组成部分及其相关参考文献为 grounding。我们提出了一种数据收集策略,用于从 OpenReview 收集这些问答对,并将其与来自 LaTeX 源文件的上下文信息关联。此外,我们呈现了一系列基线方法,利用大语言模型(LLM)以零-shot 和 fine-tuned 配置来解决 cPAPERS 数据集。

关键词

引用

@article{arxiv.2406.08398,
  title  = {cPAPERS: A Dataset of Situated and Multimodal Interactive Conversations in Scientific Papers},
  author = {Anirudh Sundar and Jin Xu and William Gay and Christopher Richardson and Larry Heck},
  journal= {arXiv preprint arXiv:2406.08398},
  year   = {2024}
}

备注

14 pages, 1 figure