基于 token 的 in-context learning 决策标准次优
计算与语言
2025-02-06 v3 人工智能
机器学习
摘要
in-context learning (ICL) 通常利用输出概率中手动挑选标签 token 的分类准则。然而,我们认为此类基于 token 的分类准则导致决策边界次优,尽管经过了精细的平移和受限旋转校准。为解决此问题,我们提出了 Hidden Calibration 方法,放弃基于 token 概率,改用 LM 最后隐藏状态上最近质心分类器。在细节方面,我们将距离 calibration 集中估计的最近质心的标签分配给测试样本作为预测标签。我们在 6 个模型和 10 个分类数据集上的实验表明,Hidden Calibration 在当前基于 token 的基线上持续优越约 20%~50%,达到 ICL 的强劲 state-of-the-art 水平。我们的进一步分析表明,Hidden Calibration 找到更好的分类准则,类别间重叠更小;LM 在演示帮助下提供线性可分的类内簇,这支持 Hidden Calibration 并为 ICL 的原理提供新见解。我们的官方代码实现可在 https://github.com/hc495/Hidden_Calibration 查阅。
引用
@article{arxiv.2406.16535,
title = {Token-based Decision Criteria Are Suboptimal in In-context Learning},
author = {Hakaze Cho and Yoshihiro Sakai and Mariko Kato and Kenshiro Tanaka and Akira Ishii and Naoya Inoue},
journal= {arXiv preprint arXiv:2406.16535},
year = {2025}
}
备注
24 pages, 15 figures, 13 tables. NAACL 2025 Main Conference Accepted. Camera-ready version