中文

MoXaRt:面向增强现实的音视频对象导向声 interaction

声音 2026-03-12 v1 计算机视觉与模式识别 人机交互

摘要

在增强现实 (XR) 环境中,复杂的声学环境常常让用户感到混乱,影响场景感知和社交交互,因为声源相互交织。我们引入 MoXaRt,一个实时的 XR 系统,通过音视频线索分离这些声源,实现精细的声音交互。MoXaRt 的核心是级联架构,同时进行粗糙的仅音频分离和视觉检测源位置(如人脸、乐器)。这些视觉锚点 then 指导细化网络隔离单个声源,在处理最多 5 个并发声源(如 2 位语音 + 3 件乐器)时,仅需约 2 秒的处理延迟。我们通过在 30 组一分钟时长的包含语音和音乐的录音数据集上的技术评估,以及 22 名参与者的用户研究来验证 MoXaRt。经验结果表明,该系统在抗干扰声学环境中显著提升了语音清晰度,听力理解能力提升 36.2%(p < 0.01),同时显著降低了认知负荷(p < 0.001),为更具感知性和社交适应性的 XR 体验铺平了道路。

关键词

引用

@article{arxiv.2603.10465,
  title  = {MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR},
  author = {Tianyu Xu and Sieun Kim and Qianhui Zheng and Ruoyu Xu and Tejasvi Ravi and Anuva Kulkarni and Katrina Passarella-Ward and Junyi Zhu and Adarsh Kowdle},
  journal= {arXiv preprint arXiv:2603.10465},
  year   = {2026}
}