大语言模型是否与人机交互中的人类社会直觉相一致?
机器人学
2025-05-28 v2 人工智能
人机交互
摘要
大语言模型(LLM)日益应用于机器人技术中,尤其是用于高层动作规划。同时,许多机器人应用涉及人类监督者或协作者。因此,LLM 生成符合人们偏好和价值观且为社会所接受的行动至关重要。在这项工作中,我们测试了 LLM 在人机交互(HRI)场景中是否捕捉到了人们关于行为判断和沟通偏好的直觉。为了进行评估,我们重现了三项 HRI 用户研究,将 LLM 的输出与真实参与者的输出进行比较。我们发现 GPT-4 显著优于其他模型,在两项研究中生成的答案与用户的答案高度相关 第一项研究涉及在各种情况下为机器人选择最合适的沟通行为( = 0.82),第二项研究涉及判断行为的合意性、意图性和意外性( = 0.83)。然而,对于最后一项测试人们是否对机器人和人类行为做出不同判断的研究,没有模型达到强相关性。此外,我们表明视觉模型无法捕捉视频刺激的本质,且 LLM 倾向于将不同的沟通行为和行为合意性评价得高于人类。
引用
@article{arxiv.2403.05701,
title = {Are Large Language Models Aligned with People's Social Intuitions for Human-Robot Interactions?},
author = {Lennart Wachowiak and Andrew Coles and Oya Celiktutan and Gerard Canal},
journal= {arXiv preprint arXiv:2403.05701},
year = {2025}
}
备注
Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024