中文

应谁作答?基于 Transformer 的多方社交机器人交互模型

机器人学 2025-07-16 v1 计算机视觉与模式识别

摘要

先前的人机交互(HRI)研究主要关注单用户交互,机器人不需要考虑响应的时机或接收者。在多方交互场景中,例如购物中心和医院,社交机器人必须理解情境并决定何时以及向谁作答。本文提出了一个基于 Transformer 的多任务学习框架,以提高社交机器人在多用户环境中的决策过程。考虑到 HRI 的特点,我们提出了两种新的损失函数:一种对活跃说话者施加约束以改进场景建模,另一种引导响应选择指向专门针对机器人的言语。此外,我们构建了一个新的数据集,捕捉真实世界的复杂性,如凝视错位。实验结果表明,我们的模型在应答决策方面实现了最先进的性能,超越了现有的基于启发式的方法和单任务方法。我们的发现促进了能够在自然且情境感知的多方交互中进行的社交聪明机器人的发展。

关键词

引用

@article{arxiv.2507.10960,
  title  = {Whom to Respond To? A Transformer-Based Model for Multi-Party Social Robot Interaction},
  author = {He Zhu and Ryo Miyoshi and Yuki Okafuji},
  journal= {arXiv preprint arXiv:2507.10960},
  year   = {2025}
}