EgoSpeak:野外以太空式对话智能体学习何时发言
计算机视觉与模式识别
2025-02-24 v1 人工智能
摘要
预测在真实环境中何时发言仍是对话式智能体的基本挑战。我们引入EgoSpeak,一个用于以太空式视频实时发言预测的新型框架。通过建模来自说话者第一人称视角的对话,EgoSpeak为人类化交互而设计,要求对话式智能体持续观察其环境并动态决定何时发言。我们的ethods通过整合四项关键能力来弥合简化实验 setup 与复杂自然对话之间的鸿沟:(1)第一人称视角,(2)RGB处理,(3)在线处理,(4)未剪辑视频处理。我们还呈现YT-Conversation,一个来自YouTube的多样化对话视频集合,作为大规模预训练资源。在EasyCom和Ego4D上的实验表明,EgoSpeak在实时条件下优于随机和静默基准。我们的结果还突显了多模态输入和上下文长度在有效决定何时发言方面的重要性。
引用
@article{arxiv.2502.14892,
title = {EgoSpeak: Learning When to Speak for Egocentric Conversational Agents in the Wild},
author = {Junhyeok Kim and Min Soo Kim and Jiwan Chung and Jungbin Cho and Jisoo Kim and Sungwoong Kim and Gyeongbo Sim and Youngjae Yu},
journal= {arXiv preprint arXiv:2502.14892},
year = {2025}
}
备注
NAACL 2025 Findings. Project page at https://jun297.github.io/EgoSpeak/