An Eye for an Ear: 利用图像字幕器实现零样态音频描述
音频与语音处理
2024-10-10 v1 计算机视觉与模式识别
机器学习
声音
摘要
多模态大语言模型推动了图像字幕技术的进展。这些在广泛图像数据集上微调的模型展现出对语义概念的深入理解。本文展示了这种能力可被重新用于音频字幕,即通过多模态对齐,将图像序列中关联的听觉内容描述出来。这种对齐因实际视频中听觉元素与可见元素的本质差异而具有挑战性。此外,多模态表征学习常依赖对比学习,面临所谓的模态间隙问题,阻碍模态间的平滑集成。本文引入一种新方法,通过匹配由音频主干网络和图像字幕器产生的 token 分布来弥合音频-视觉模态间隙。我们的做法将音频 token 分布与图像 token 分布对齐,从而在无监督情况下实现零样态音频字幕,同时保持原始的图像字幕组件不变。这种对齐允许使用音频或音视频输入,通过组合或替换图像编码器来使用对齐后的音频编码器。我们的方法在零样态音频字幕方面显著优于现有方法。
引用
@article{arxiv.2410.05997,
title = {An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment},
author = {Hugo Malard and Michel Olvera and Stéphane Lathuiliere and Slim Essid},
journal= {arXiv preprint arXiv:2410.05997},
year = {2024}
}