中文

通过多教师蒸馏学习任务无关表示

机器学习 2025-10-22 v1

摘要

将复杂输入转化为易于处理的表示是各个领域的关键步骤。架构、损失函数、输入模态和数据集的差异催生了多样的嵌入模型,每个模型都捕捉了输入的独特方面。多教师蒸馏利用这种多样性来丰富表示,但通常仍针对特定任务量身定制。在本文中,我们引入了一个基于“多数投票”目标函数的任务无关框架。我们证明该函数受限于学生模型与教师模型嵌入之间的互信息,从而导出一种消除了对特定任务标签或先验知识依赖的任务无关蒸馏损失。我们在文本、视觉模型和分子建模方面的评估表明,我们的方法有效利用了教师的多样性,生成的表示在分类、聚类或回归等广泛的下游任务中实现了更好的性能。此外,我们训练并发布了最先进的嵌入模型,增强了各种模态的下游性能。

关键词

引用

@article{arxiv.2510.18680,
  title  = {Learning Task-Agnostic Representations through Multi-Teacher Distillation},
  author = {Philippe Formont and Maxime Darrin and Banafsheh Karimian and Jackie CK Cheung and Eric Granger and Ismail Ben Ayed and Mohammadhadi Shateri and Pablo Piantanida},
  journal= {arXiv preprint arXiv:2510.18680},
  year   = {2025}
}

备注

NeurIPS-2025