无监督音频-字幕对齐学习单个声音事件与文本短语间的对应关系
音频与语音处理
2022-02-22 v2 信号处理
摘要
我们研究通过将对整段音频片段内容进行描述的文本字幕与音频片段对齐,无监督地学习声音事件与文本短语之间的对应关系。我们利用模态特定编码器编码音频帧与词,并通过评分其相似度、采用排序损失准则优化模型,从而对齐原本未对齐且无标注的音频片段与其字幕。训练后,我们通过平均帧-词相似度获得片段-字幕相似度,并通过计算帧-短语相似度估计事件-短语对应关系。我们用两个跨模态任务评估该方法:音频-字幕检索,以及基于短语的声音事件检测(SED)。实验结果表明,所提方法能以无监督方式全局关联音频片段与字幕,并局部学习单个声音事件与文本短语之间的对应关系。
引用
@article{arxiv.2110.02939,
title = {Unsupervised Audio-Caption Aligning Learns Correspondences between Individual Sound Events and Textual Phrases},
author = {Huang Xie and Okko Räsänen and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2110.02939},
year = {2022}
}
备注
Accepted at ICASSP 2022