虚拟智能体如何决定看向何处?面向具身头部旋转的符号化认知推理
图形学
2026-01-08 v2
摘要
自然的头部旋转对于可信的具身虚拟智能体至关重要,然而这种微观行为在很大程度上仍未得到充分探索。虽然头部旋转预测算法原则上可以重现这种行为,但它们通常侧重于视觉显著刺激,而忽略了引导头部旋转的认知动机。这导致智能体只注视显眼物体,而忽略障碍物或任务相关线索,从而降低了虚拟环境中的真实感。我们提出 SCORE,一种面向具身头部旋转的符号化认知推理框架,这是一个与数据无关的框架,无需特定任务训练或手动调整启发式规则即可生成上下文感知的头部运动。一项受控 VR 研究(N=20)确定了人类头部运动的五个动机驱动因素:兴趣、信息寻求、安全、社交图式和习惯。SCORE 将这些驱动因素编码为符号化谓词,使用视觉语言模型(VLM)感知场景,并利用大语言模型(LLM)规划头部姿态。该框架采用混合工作流:VLM-LLM 推理离线执行,之后由轻量级 FastVLM 进行在线验证,以抑制幻觉,同时保持对场景动态的响应能力。其结果是,智能体不仅能预测看向何处,还能预测为何看向该处,能够泛化到未见场景和多智能体人群,同时保持行为合理性。
引用
@article{arxiv.2508.08930,
title = {How Does a Virtual Agent Decide Where to Look? Symbolic Cognitive Reasoning for Embodied Head Rotation},
author = {Juyeong Hwang and Seong-Eun Hong and JaeYoung Seon and Hyeongyeop Kang},
journal= {arXiv preprint arXiv:2508.08930},
year = {2026}
}
备注
13 pages, 8 figures. Accepted to SIGGRAPH Asia Conference Papers '25