中文

了不起的脑子是否如此?——基于CAIMIRA探究人类-人工智能在问答中的互补性

计算与语言 2024-10-10 v1 人工智能 机器学习

摘要

最近的大型语言模型(LLM)的快速发展导致人们声称AI在自然语言处理(NLP)任务中(如文本理解和推理)超过了人类。本 work 通过引入CAIMIRA,一种根植于项目反应理论(IRT)的新型框架,实现对问答(QA)代理(人类和AI系统)问题解决能力的定量评估与比较。通过分析超过30万次来自约70个AI系统和155个人的响应,CAIMIRA 揭示了知识领域和推理技能的不同专业能力模式。人类在知识 grounding 的归纳推理和概念推理中超过AI系统,而像GPT-4和LLaMA这类最先进的LLM在针对性信息检索和基于事实的推理中表现更佳,尤其是在信息缺口明确且可通过模式匹配或数据检索解决时。这一发现凸显了未来QA任务需要聚焦于挑战不仅高阶推理和科学思维,还需进行细致语言解释和跨情境知识应用的问题,以推动AI发展更好地模拟或补充人类认知能力于现实问题解决中。

关键词

引用

@article{arxiv.2410.06524,
  title  = {Do great minds think alike? Investigating Human-AI Complementarity in Question Answering with CAIMIRA},
  author = {Maharshi Gor and Hal Daumé and Tianyi Zhou and Jordan Boyd-Graber},
  journal= {arXiv preprint arXiv:2410.06524},
  year   = {2024}
}

备注

To appear at EMNLP 2024 (Main)