中文

EigeNet:面向少样本新视角RIR预测的几何感知多模态学习

声音 2026-05-28 v1 人工智能 多媒体

摘要

从稀疏观测预测空间变动的房间脉冲响应(RIR)是沉浸式空间音频渲染中的关键但高度具有挑战性的逆问题。本文提出EIGENET,一个几何感知的多模态框架,用于少样本新视角RIR预测。其核心是一种Cross-view Alternate-attention Transformer,迭代细化局部视内声学结构和全局跨视角空间关系。我们实证表明,该架构能够充分利用多视角多模态语境,同时为RIR预测进行空间-时间推理。灵感来源于声学射线追踪,我们设计了几何感知调制模块,以刻画几何特征与RIR功率谱之间的联系。同时,引入辅助损失,将单目标波形预测转化为多任务学习框架。通过消融研究,我们证明该设计无论基于何种底层架构均能获得一致的性能提升,从而确认其在RIR预测任务中的基础实用性和架构无关的通用性。评估在模拟和真实基准上进行,EIGENET实现了少样本新视角RIR预测的状态最前绩效,并实现了仿真到真实的泛化。代码和模型已发布于https://github.com/FEAfeatherTHER/EigeNet。

关键词

引用

@article{arxiv.2605.28101,
  title  = {EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction},
  author = {Chong Jing and Zitong Lan and Junan Zhang and Zhizheng Wu},
  journal= {arXiv preprint arXiv:2605.28101},
  year   = {2026}
}

备注

Code available on https://github.com/FEAfeatherTHER/EigeNet