TextManiA:基于文本驱动的流形增强以丰富视觉特征
计算机视觉与模式识别
2023-09-12 v3
摘要
我们提出 TextManiA,一种文本驱动的流形增强方法,它能在不考虑类别分布的情况下从语义上丰富视觉特征空间。TextManiA 通过利用易于理解的视觉拟态词(即属性)进行类内语义扰动来增强视觉数据。本工作建立在一个有趣的假设之上:通用语言模型(如 BERT 和 GPT)即使未在视觉训练数据上训练,也在一定程度上包含了视觉信息。基于该假设,TextManiA 将来自成熟大语言编码器的预训练文本表示迁移到正在学习的目标视觉特征空间。我们的广泛分析暗示,语言编码器确实包含了至少对增强视觉表示有用的视觉信息。我们的实验表明,TextManiA 在样本稀缺且类别不平衡以及均匀分布的情况下都尤为有效。我们还展示了其与基于标签混合的方法在均匀分布稀缺数据中的兼容性。
引用
@article{arxiv.2307.14611,
title = {TextManiA: Enriching Visual Feature by Text-driven Manifold Augmentation},
author = {Moon Ye-Bin and Jisoo Kim and Hongyeob Kim and Kilho Son and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2307.14611},
year = {2023}
}
备注
Accepted at ICCV 2023. [Project Pages] https://textmania.github.io/