$\texttt{DIAMONDs}$:用于$\mathbb{D}$ynamic$\mathbb{I}$nformation$\mathbb{A}$nd$\mathbb{M}$ental modeling$\mathbb{O}$f$\mathbb{N}$umeric$\mathbb{D}$iscussions的数据集
人工智能
2025-05-20 v1
摘要
理解多方对话需要强大的Theory of Mind(ToM)能力,包括跟踪动态信息、管理知识不对称以及区分跨越扩展交换的相关信息。为推进此类情境下的ToM评估,我们设计了一种可扩展的高质量方法,用于生成具有上述特征的对话问答对。通过该方法,我们创建了,一个覆盖常见商业、财务或其他群体交互的对话式问答数据集。在这些以目标为导向的对话中,参与者常需跟踪某些感兴趣的数值量(如"预期利润"),这些量可由其他变量量(如"营销费用、预期销售额、薪资"等)推导出,其值也随对话进程变化。的问题在对话中交换的信息背景下提出简单的数值推理问题(如"慈善活动所需资金、下季度预期公司利润"等),以精确评估ToM在跟踪和推理参与者知识状态方面的能力。我们评估了最先进的语言模型,发现其在处理参与者中心推理方面面临重大挑战,尤其是当参与者持有错误信念时。模型在包含干扰项的对话中也表现不佳,且在识别信息不足情形的能力有限。这些发现凸显了当前模型在处理现实多方对话中ToM能力的局限性。
引用
@article{arxiv.2505.12651,
title = {$\texttt{DIAMONDs}$: A Dataset for $\mathbb{D}$ynamic $\mathbb{I}$nformation $\mathbb{A}$nd $\mathbb{M}$ental modeling $\mathbb{O}$f $\mathbb{N}$umeric $\mathbb{D}$iscussions},
author = {Sayontan Ghosh and Mahnaz Koupaee and Yash Kumar Lal and Pegah Alipoormolabashi and Mohammad Saqib Hasan and Jun Seok Kang and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:2505.12651},
year = {2025}
}