将格式视为先验:量化与分析 LLM 在异构数据中的偏差
计算与语言
2026-01-14 v3 机器学习
摘要
大型语言模型(LLM)越来越被用于处理来自异构格式的信息,包括文本、表格、信息框和知识图谱。然而,对特定格式的系统性偏差可能削弱 LLM 在公正地整合异构数据方面的能力,潜在导致推理错误并增加下游任务中的风险。然而,仍不清楚这些偏差是否具有系统性、哪些数据层面的因素驱动它们、以及它们的内部机制为何。本文通过三个阶段的实证分析,首次全面研究 LLM 中的格式偏差。第一个阶段探讨了这种偏差在多样化 LLM 中的存在情况及其方向。第二个阶段检验了关键数据层面因素如何影响这些偏差。第三个阶段分析了格式偏差在 LLM 注意力模式中的如何出现,并评估了一种轻量级干预措施的有效性。我们的结果表明,格式偏差在模型家族中是一致的,由信息丰富度、结构质量和表示类型驱动,并且与 LLM 中的注意力不平衡密切相关。基于这些调查,我们识别出三条未来研究方向以减少格式偏差:通过格式修复和标准化增强数据预处理、引入推理时干预措施如注意力重新加权,以及开发格式平衡的训练语料库。这些方向将支持设计更稳健和公平的异构数据处理系统。
引用
@article{arxiv.2508.15793,
title = {Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data},
author = {Jiacheng Liu and Mayi Xu and Qiankun Pi and Wenli Li and Ming Zhong and Yuanyuan Zhu and Mengchi Liu and Tieyun Qian},
journal= {arXiv preprint arXiv:2508.15793},
year = {2026}
}
备注
Accepted by AAAI 2026, camera ready version