中文

面向金融语言模型的更高效偏见检测

人工智能 2026-03-10 v1 计算工程、金融与科学 机器学习

摘要

金融语言模型中的偏见构成了其在实际应用中采纳的主要障碍。检测此类偏见具有挑战性,因为需要识别其预测在改变与决策无关的属性(如人口统计特征)时发生变化的输入。现有方法通常依赖对大型语料库进行 exhaustive 变异和成对预测分析,虽有效但计算成本高——尤其是对于大型语言模型,在持续 retraining 和发布过程中可能变得不可行。旨在降低此类成本,我们对五种金融语言模型进行大规模偏见研究,检验其在受保护属性上的偏见倾向之间的相似性,并探索跨模型引导的偏见检测,以更早识别揭示偏见的输入。我们的研究使用约 17k 条真实金融新闻句子,通过变异构造超过 125k 对原句-变异句对。结果表明,所有模型在原子 (0.58%-6.05%) 和交叉 (0.75%-5.97%) 设置下均显示偏见。此外,我们观察到偏见揭示输入在模型之间保持一致的模式,这使得偏见检测的成本显著降低。例如,使用仅 20% 的输入对即可揭示 FinMA 的 73% 有偏见行为。

关键词

引用

@article{arxiv.2603.08267,
  title  = {Towards a more efficient bias detection in financial language models},
  author = {Firas Hadj Kacem and Ahmed Khanfir and Mike Papadakis},
  journal= {arXiv preprint arXiv:2603.08267},
  year   = {2026}
}