面向噪声上下文学习文本生成的双重去偏
计算与语言
2025-06-24 v2 人工智能
摘要
上下文学习 (ICL) 严重依赖于从大型标注语料库中提取的高质量示例。现有方法通过排列局部困惑度来检测噪声标注,假设噪声样本比其干净样本产生更高的困惑度。然而,当噪声比例很高且许多示例存在缺陷时,这一假设便不再成立。我们重新审视了噪声标注下用于文本生成的基于困惑度的范式,突出了困惑度中两个偏差来源:标注本身以及大语言模型 (LLM) 中固有的领域特定知识。为了克服这些偏差,我们引入了一个双重去偏框架,该框架使用合成的邻近样本显式校正困惑度估计,从而产生一个稳健的样本清洁度评分。该指标揭示了绝对的样本清洁度,而不受整体语料库噪声水平的影响。大量实验表明,我们的方法具有卓越的噪声检测能力,并且其最终的 ICL 性能与完全干净的示例语料库相当。此外,即使噪声比例极高,我们的方法依然保持稳健。
引用
@article{arxiv.2506.00418,
title = {Dual Debiasing for Noisy In-Context Learning for Text Generation},
author = {Siqi Liang and Sumyeong Ahn and Paramveer S. Dhillon and Jiayu Zhou},
journal= {arXiv preprint arXiv:2506.00418},
year = {2025}
}
备注
Accepted by 2025 ACL Findings