中文

面向更智能机器人的数据表示:提升可解释性的多模态上下文表示

人机交互 2025-03-24 v1 人工智能 机器人学

摘要

人工智能(AI)近年来取得了显著进展,推动了多个领域的创新,尤其是机器人技术。尽管机器人能够实现日益复杂的任务并具备越来越高的自主性,但在确保可解释性和用户中心设计以实现有效交互方面仍面临挑战。在人机交互(HRI)中,一个关键问题是使机器人能够有效感知和推理多模态输入(如音频和视觉),以培育信任和无缝协作。本文提出了一个通用且可解释的多模态框架,用于上下文表示,以改进语音和视觉模态的融合。我们引入了一个用例,用于评估用户语音话语与机器人视觉场景感知之间的'相关性'。我们呈现了包含多模态联合表示模块和时间对齐模块的方法,这些方法允许机器人通过时间对齐多模态输入来评估相关性。最后,我们讨论了所提出的上下文表示框架如何有助于HRI的各个方面实现可解释性。

关键词

引用

@article{arxiv.2503.16467,
  title  = {Enhancing Explainability with Multimodal Context Representations for Smarter Robots},
  author = {Anargh Viswanath and Lokesh Veeramacheneni and Hendrik Buschmeier},
  journal= {arXiv preprint arXiv:2503.16467},
  year   = {2025}
}

备注

Presented at 3rd Workshop on Explainability in Human-Robot Collaboration at HRI 2025