ArgSciChat:面向科学论文的论证性对话数据集
计算与语言
2022-10-14 v3
摘要
面向科学学科(作为专家领域)的对话智能体的应用因缺乏训练此类智能体的对话数据而研究不足。尽管大多数数据收集框架(如 Amazon Mechanical Turk)通过连接众包工人与任务设计者来促进通用领域的数据收集,这些框架并未针对专家领域的数据收集进行优化。由于时间预算有限,科学家很少出现在这些框架中。因此,我们引入了一种新颖框架,用于收集科学家作为领域专家就科学论文展开的对话。我们的框架让科学家展示其科学论文作为对话的依据,并参与他们喜欢其论文标题的对话。我们利用该框架收集了一个新颖的论证性对话数据集 ArgSciChat。它包含从 20 篇科学论文上的 41 段对话中收集的 498 条消息。除对 ArgSciChat 的广泛分析外,我们还在该数据集上评估了一个近期的对话智能体。实验结果表明,该智能体在 ArgSciChat 上表现不佳,这激励了针对论证性科学智能体的进一步研究。我们发布了框架与数据集。
引用
@article{arxiv.2202.06690,
title = {ArgSciChat: A Dataset for Argumentative Dialogues on Scientific Papers},
author = {Federico Ruggeri and Mohsen Mesgar and Iryna Gurevych},
journal= {arXiv preprint arXiv:2202.06690},
year = {2022}
}