从视频生成视觉对齐的声音
计算机视觉与模式识别
2023-07-19 v1 声音
音频与语音处理
摘要
我们关注从自然视频生成声音的任务,所生成的声音应在时间和内容上与视觉信号对齐。该任务极具挑战性,因为某些在相机外产生的声音无法从视频内容推断,模型可能被强迫学习视觉内容与这些无关声音之间的错误映射。为应对这一挑战,我们提出名为 REGNET 的框架。在该框架中,我们首先从视频帧提取外观与运动特征,以更好地区分发声物体与复杂背景信息。随后我们引入一种创新的音频前向正则化器,直接将真实声音作为输入并输出瓶颈化声音特征。在训练中使用视觉与瓶颈化声音特征进行声音预测,为声音预测提供了更强的监督。音频前向正则化器可控制无关声音分量,从而防止模型学习屏幕外物体所发声与视频帧之间的错误映射。测试时移除音频前向正则化器,以确保 REGNET 仅从视觉特征生成纯对齐的声音。基于 Amazon Mechanical Turk 的大量评估表明,我们的方法显著改善了时间对齐与内容对齐。值得注意的是,生成的声音以 68.12% 的成功率骗过了人类。代码与预训练模型公开于 https://github.com/PeihaoChen/regnet
引用
@article{arxiv.2008.00820,
title = {Generating Visually Aligned Sound from Videos},
author = {Peihao Chen and Yang Zhang and Mingkui Tan and Hongdong Xiao and Deng Huang and Chuang Gan},
journal= {arXiv preprint arXiv:2008.00820},
year = {2023}
}
备注
Published in IEEE Transactions on Image Processing, 2020. Code, pre-trained models and demo video: https://github.com/PeihaoChen/regnet