提升群体鲁棒性:精准推断虚假关联需要更精细的群体推断
机器学习
2024-06-05 v2
摘要
标准经验风险最小化 (ERM) 模型可能优先学习虚假关联,这些关联与真实标签之间存在关联,从而导致在这些关联不成立的群体上的准确性差。缓解这一问题通常需要昂贵的虚假属性 (群体) 标签,或依赖训练好的 ERM 模型在缺乏群体信息时推断群体标签。然而,使用伪群体标签与使用神谕群体标签之间在最差群体准确性上的显著差距启发我们考虑通过更精准的群体推断来进一步提升群体鲁棒性。因此,我们提出了 GIC 方法,这是一种准确推断群体标签的新方法,结果是改进了最差群体性能。GIC 基于虚假关联的两个关键属性训练虚假属性分类器:(1) 虚假属性与真实标签之间的高度相关性,(2) 这种相关性在不同群体分布数据集之间存在差异。来自多个数据集的实证研究表明,GIC 在推断群体标签方面有效,并且将 GIC 与各种下游不变学习方法结合使用可提高最差群体准确性,凸显其强大的灵活性。此外,通过分析 GIC 中的误分类,我们识别出一种称为语义一致性的有趣现象,这可能有助于更好地分离虚假属性与标签之间的关联,从而缓解虚假关联。GIC 的代码可在 https://github.com/yujinhanml/GIC 上获得。
引用
@article{arxiv.2404.13815,
title = {Improving Group Robustness on Spurious Correlation Requires Preciser Group Inference},
author = {Yujin Han and Difan Zou},
journal= {arXiv preprint arXiv:2404.13815},
year = {2024}
}
备注
25 pages, 13 figures, 8 tables