中文

TextTeacher:语言能教会图像吗?

计算机视觉与模式识别 2026-05-22 v1 人工智能 机器学习

摘要

柏拉图式表征假设认为,充分大的模型即使跨模态,也会收敛到共享的表征几何。以此为动机,我们提出问题:语言模型的语义知识能否有效提升视觉模型?作为答案,我们引入 TextTeacher,一种简单的辅助目标,将文本嵌入作为额外信息注入图像分类训练。TextTeacher 使用 readily available 的图像描述,结合预训练且冻结的文本编码器,以及轻量级投影层,产生语义锚点,有效地在训练初期引导表征,同时在推理时间模型保持不变。在 ImageNet 上使用标准 ViT 主干网络时,TextTeacher 在准确率上提升最高可达 +2.7 个百分点,并在相同配方和计算资源下实现持续的迁移收益(平均 +1.0 个百分点)。它超越了视觉知识蒸馏,在恒定计算预算下获得更高准确率,或在相同准确率下快 33%。我们的分析表明,TextTeacher 充当特征空间的 Preconditioner,在训练前期的深层次塑造表征,辅助通过补充语义线索来提升泛化能力。TextTeacher 增加的开销可忽略不计,无需对目标模型进行高成本的多模态训练,保留了纯视觉模型的简单性和延迟。项目页面附有代码和描述:https://nauen-it.de/publications/text-teacher

关键词

引用

@article{arxiv.2605.22098,
  title  = {TextTeacher: What Can Language Teach About Images?},
  author = {Tobias Christian Nauen and Stanislav Frolov and Brian Bernhard Moser and Federico Raue and Ahmed Anwar and Andreas Dengel},
  journal= {arXiv preprint arXiv:2605.22098},
  year   = {2026}
}

备注

Published at TMLR