聆听双手:3D场景中物理交互的声音生成
计算机视觉与模式识别
2025-06-12 v1
摘要
我们研究了通过以下问题使3D场景重建具有交互性的方法:能否预测人类双手与场景物理交互所产生的声音?首先,我们录制了一段人类使用双手在3D场景中操作物体的视频。然后,我们利用这些动作-声音配对训练一个修正流(rectified flow)模型,将3D手部轨迹映射到对应的音频。在测试阶段,用户可以查询模型以获取其他动作(以手部姿态序列参数化),从而估计其对应的声音。在我们的实验中,我们发现生成的声音能够准确传达材质属性和动作,并且常常与真实声音难以区分给人类观察者。项目页面:https://www.yimingdou.com/hearing_hands/
引用
@article{arxiv.2506.09989,
title = {Hearing Hands: Generating Sounds from Physical Interactions in 3D Scenes},
author = {Yiming Dou and Wonseok Oh and Yuqing Luo and Antonio Loquercio and Andrew Owens},
journal= {arXiv preprint arXiv:2506.09989},
year = {2025}
}
备注
CVPR 2025, Project page: https://www.yimingdou.com/hearing_hands/ , Code: https://github.com/Dou-Yiming/hearing_hands/