论文思维基准的再思考:面向用户中心的视角
人机交互
2025-04-16 v1 人工智能
摘要
过去几年来,越来越多的研究尝试将为人类设计的思维-心智(Theory-of-Mind, ToM)任务用于基准化评估大语言模型(LLM)的思维-心智能力,从而作为其社会智能能力的指示。然而,这种方法存在诸多局限性。基于现有的心理学和人工智能文献,我们总结了理论、方法学以及评估层面的局限性,指出原本用于评估人类思维-心智的某些问题在被移植到评估LLM思维-心智时,仍然存在并被加剧。站在人机交互(Human-Computer Interaction, HCI)的视角,这些局限性促使我们重新思考在更动态、互动的框架下,对思维-心智基准中思维-心智的定义与标准进行重新把握,以充分考虑用户在评估中对LLM的偏好、需求与体验。我们 conclude by outlining potential opportunities and challenges towards this direction.(我们通过勾勒潜在的机遇与挑战,为这一方向指明前进之路。)
引用
@article{arxiv.2504.10839,
title = {Rethinking Theory of Mind Benchmarks for LLMs: Towards A User-Centered Perspective},
author = {Qiaosi Wang and Xuhui Zhou and Maarten Sap and Jodi Forlizzi and Hong Shen},
journal= {arXiv preprint arXiv:2504.10839},
year = {2025}
}
备注
7 pages, 1 figure, accepted to the HEAL@CHI 2025 Workshop