LLM 上下文学习中表格数据生成的偏差传播
机器学习
2026-01-29 v2
摘要
大语言模型(LLM)越来越多地通过上下文学习(ICL)用于合成表格数据生成,为数据稀缺场景下的数据增强提供了实用解决方案。虽然先前工作表明 LLM 有潜力通过增强代表性不足的群体来改善下游任务性能,但这些益处通常假设可以访问一组无偏的上下文示例,能够代表真实数据集。然而,在现实场景中,数据经常存在噪声和人口统计偏差。在本文中,我们系统地研究了上下文示例中的统计偏差如何传播到合成表格数据的分布中,表明即使是轻微的上下文偏差也会导致全局统计失真。我们进一步引入了一个对抗场景,其中恶意贡献者可以通过一部分上下文示例将偏差注入合成数据集,最终损害针对特定受保护群体的下游分类器的公平性。最后,我们评估了基于预处理上下文示例的缓解策略,结果表明虽然此类干预可以缩小差异,但 LLM 对对抗提示的固有敏感性仍然是一个持续的挑战。我们的发现揭示了 LLM 数据生成流水线在敏感领域中的一个关键新漏洞。
引用
@article{arxiv.2506.09630,
title = {In-Context Bias Propagation in LLM-Based Tabular Data Generation},
author = {Pol G. Recasens and Alberto Gutierrez and Jordi Torres and Josep. Ll Berral and Javier Carnerero-Cano and Anisa Halimi and Kieran Fraser},
journal= {arXiv preprint arXiv:2506.09630},
year = {2026}
}