中文

评估基于表格到文本序列化方法的LLM公平性与表现

机器学习 2025-09-01 v1 计算与语言 计算机与社会

摘要

大型语言模型(LLMs)越来越多地被用于高风险决策任务,如贷款批准。尽管其应用跨越多个领域,但LLMs在处理表格数据方面存在挑战,难以确保公平性并提供可靠的预测。在本工作中,我们评估了LLMs在来自三个不同地理区域(加纳、德国和美国)的序列化贷款批准数据集上的性能和公平性。我们的评估关注模型的零样本和情境学习(ICL)能力。我们的结果表明,序列化格式的选择显著影响LLMs的性能和公平性,其中某些格式(如GReat和LIFT)可产生更高的F1分数,但会加剧公平性差异。值得注意的是,虽然ICL相对于零样本基线提高了4.9-59.6%的模型性能,但其对公平性的影响在不同数据集之间差异很大。我们的工作强调了有效表格数据表示方法和面向公平性的模型的重要性,以提高LLMs在金融决策中的可靠性。

关键词

引用

@article{arxiv.2508.21512,
  title  = {Accept or Deny? Evaluating LLM Fairness and Performance in Loan Approval across Table-to-Text Serialization Approaches},
  author = {Israel Abebe Azime and Deborah D. Kanubala and Tejumade Afonja and Mario Fritz and Isabel Valera and Dietrich Klakow and Philipp Slusallek},
  journal= {arXiv preprint arXiv:2508.21512},
  year   = {2025}
}