TextME:通过文本描述桥接未见模态
机器学习
2026-02-24 v2 人工智能
摘要
将多模态表示扩展到新模态受限于依赖大规模配对数据集(如文本-图像、文本-音频、文本-3D、文本-分子),这些数据集在需要专家标注的领域(如医学成像和分子分析)成本高昂且往往难以获取。我们提出TextME——已知最前沿的文本唯一模态扩展框架,将多样化模态投射到LLM嵌入空间作为统一锚点。我们的ethods利用预训练对比编码器的几何结构,仅通过文本描述实现零样本跨模态迁移,无需配对监督。我们经验性地验证了这种一致的模态间隙在图像、视频、音频、3D、X光和分子领域均存在,表明仅用文本训练可保留预训练编码器的大部分性能。我们进一步展示了该框架可实现训练时未显式对齐的模态对之间的新兴跨模态检索(如音频到图像、3D到图像)。这些结果表明,仅文本训练是配对监督的实用替代方案。
引用
@article{arxiv.2602.03098,
title = {TextME: Bridging Unseen Modalities Through Text Descriptions},
author = {Soyeon Hong and Jinchan Kim and Jaegook You and Seungtaek Choi and Suha Kwak and Hyunsouk Cho},
journal= {arXiv preprint arXiv:2602.03098},
year = {2026}
}
备注
Code available at https://github.com/SoyeonHH/TextME