基于预训练嵌入的多语言多模态主题建模
计算与语言
2022-11-16 v1 人工智能
摘要
本文提出 M3L-Contrast——一种新颖的面向可比数据的多模态多语言(M3L)神经主题模型,其将多种语言文本与图像映射至共享主题空间。我们的模型在文本与图像上联合训练,并利用预训练文档与图像嵌入来抽象不同语言与模态间的复杂性。作为多语言主题模型,它生成对齐的语种特定主题;作为多模态模型,它推断图像中语义概念的文本表示。我们证明,在预测可比多语言数据的主题分布方面,我们的模型与零样本主题模型具有竞争力,并在预测可比文本与图像的主题分布方面显著优于零样本模型。我们还表明,模型在非对齐嵌入上的表现几乎与在对齐嵌入上一样好。
引用
@article{arxiv.2211.08057,
title = {Multilingual and Multimodal Topic Modelling with Pretrained Embeddings},
author = {Elaine Zosa and Lidia Pivovarova},
journal= {arXiv preprint arXiv:2211.08057},
year = {2022}
}
备注
Published in COLING 2022 Proceddings