中文

FairHome:一个公平住房与公平贷款数据集

机器学习 2024-09-12 v1 计算机与社会

摘要

我们提出了一个公平住房与公平贷款数据集(FairHome):该数据集包含约75,000个样本,涵盖9个受保护类别。据我们所知,FairHome是首个在住房领域公开可用的、带有合规风险二分类标签的数据集。我们通过训练一个分类器,并使用它来检测在房地产交易背景下使用大型语言模型(LLM)时的潜在违规行为,从而证明了此类数据集的有用性和有效性。我们将训练好的分类器与最先进的LLM(包括GPT-3.5、GPT-4、LLaMA-3和Mistral Large)在零样本和少样本情境下进行了基准测试。我们的分类器以0.91的F1分数胜出,凸显了我们数据集的有效性。

关键词

引用

@article{arxiv.2409.05990,
  title  = {FairHome: A Fair Housing and Fair Lending Dataset},
  author = {Anusha Bagalkotkar and Aveek Karmakar and Gabriel Arnson and Ondrej Linda},
  journal= {arXiv preprint arXiv:2409.05990},
  year   = {2024}
}

备注

14 pages, 5 figures