面向实用与高效的图像到语音描述生成:基于视觉-语言预训练与多模态词元
计算机视觉与模式识别
2023-09-18 v1 计算与语言
音频与语音处理
图像与视频处理
摘要
在本文中,我们提出构建强大且高效的图像到语音描述生成(Im2Sp)模型的方法。为此,我们首先将大规模预训练视觉-语言模型中所蕴含的与图像理解和语言建模相关的丰富知识引入Im2Sp。我们将所提Im2Sp的输出设为离散化语音单元,即自监督语音模型的量化语音特征。这些语音单元主要包含语言信息,同时抑制了语音的其他特性。这使我们能够将预训练视觉-语言模型的语言建模能力融入Im2Sp的口语语言建模中。借助视觉-语言预训练策略,我们在两个广泛使用的基准数据库COCO和Flickr8k上确立了新的最优Im2Sp性能。随后,我们进一步提升Im2Sp模型的效率。类似于语音单元的情况,我们将原始图像转换为图像单元,其通过对原始图像进行向量量化得到。借助这些图像单元,相较于原始图像数据,我们能将保存图像数据所需的数据存储大幅减少至仅0.8%(以比特计)。演示页面:https://ms-dot-k.github.io/Image-to-Speech-Captioning。
引用
@article{arxiv.2309.08531,
title = {Towards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-training and Multi-modal Tokens},
author = {Minsu Kim and Jeongsoo Choi and Soumi Maiti and Jeong Hun Yeo and Shinji Watanabe and Yong Man Ro},
journal= {arXiv preprint arXiv:2309.08531},
year = {2023}
}