概率-熵校准:自适应微调的弹性指示器
机器学习
2026-05-28 v2 人工智能
摘要
基于token级别的重加权是控制监督微调的一种简单而有效的方法,但常见的指示器大多为单一维度:ground-truth概率反映下游对齐情况,而token熵反映由预训练先验引发的内在不确定性。忽略熵会将噪声或易替换的token误判为学习关键,而忽略概率则无法反映目标特定的对齐。RankTuner引入一种概率-熵校准信号——相对秩指示器(Relative Rank Indicator),该指示器比较ground-truth token的秩与其在预测分布下预期秩的比值。该逆指示器用作token级相对比例,以重新加权微调目标,聚焦于真正尚未学习的token,而不对内在不确定的位置过度惩罚。在多个 backbone 模型上的实验表明,这种方法在数学推理基准测试中一致取得改进,在分布外推理中获得迁移收益,并在代码生成任务中超越仅使用概率或仅使用熵的重加权基线。
引用
@article{arxiv.2602.01745,
title = {Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning},
author = {Wenhao Yu and Shaohang Wei and Jiahong Liu and Yifan Li and Minda Hu and Aiwei Liu and Hao Zhang and Irwin King},
journal= {arXiv preprint arXiv:2602.01745},
year = {2026}
}
备注
Accepted by ICML 2026