中文

多跳问答:人类能在何处获得帮助,何处受限?

人机交互 2025-10-07 v1

摘要

多跳问答是大型语言模型 (LLM) 和人类都具备挑战性的任务,因为它需要识别何时需要进行多跳推理,随后进行阅读理解、逻辑推理和知识集成。为更好地理解人类如何与 AI 有效协作,我们评估了众包工作者在这些 individual reasoning 子任务上的表现。我们发现尽管人类在知识集成方面表现出色(准确率为 97%),但往往无法识别问题是否需要进行多跳推理(准确率仅为 67%)。参与者在单跳和多跳问答上的表现相当不错(准确率分别为 84% 和 80%),但经常会出现语义错误——例如,回答事件发生的时间,却误答了问题询问的是事件发生的地点。这些发现凸显了设计能够补足人类常规弱点的 AI 系统的重要性。

关键词

引用

@article{arxiv.2510.04493,
  title  = {Multi-Hop Question Answering: When Can Humans Help, and Where do They Struggle?},
  author = {Jinyan Su and Claire Cardie and Jennifer Healey},
  journal= {arXiv preprint arXiv:2510.04493},
  year   = {2025}
}