TriCoLo:用于文本到形状检索的三模态对比损失
计算机视觉与模式识别
2023-12-29 v2
摘要
随着3D形状数据的增长,文本到形状检索日益成为一个相关问题。近期关于多模态数据联合嵌入学习的对比损失研究在检索与分类等任务上取得成功。迄今,关于3D形状与文本联合表示学习的工作集中于通过建模表示间复杂注意力或多任务学习来改进嵌入。我们提出一种文本、多视角图像与3D形状体素的三模态学习方案,并展示通过大批量对比学习,无需复杂注意力机制或损失即可在文本到形状检索上取得良好性能。我们的实验为后续构建文本-图像-形状三模态嵌入的工作奠定基础。
引用
@article{arxiv.2201.07366,
title = {TriCoLo: Trimodal Contrastive Loss for Text to Shape Retrieval},
author = {Yue Ruan and Han-Hung Lee and Yiming Zhang and Ke Zhang and Angel X. Chang},
journal= {arXiv preprint arXiv:2201.07366},
year = {2023}
}
备注
Accepted by WACV 2024