中文

FinTrust:面向金融领域的可信度评估综合基准

机器学习 2025-10-20 v1 计算与语言

摘要

最近的大型语言模型 (LLMs) 在解决金融相关问题方面展现出巨大的潜力。然而,由于其高风险和高风险属性,在实际金融应用中仍面临挑战。本文引入 FinTrust,一个专为评估金融领域 LLMs 可信度而设计的全面基准。我们的基准基于实际情境和特征,针对可信度评估的各个维度细化任务。我们在 FinTrust 上评估了十一个 LLMs,并发现专有模型如 o4-mini 在大多数任务(如安全性)中表现优异,而开源模型如 DeepSeek-V3 在特定领域(如行业层面公平性)中具有优势。对于像忠诚度对齐和披露这样的具挑战性的任务,所有 LLMs 都表现不足,显示出法律意识的显著差距。我们相信 FinTrust 可以是金融领域 LLMs 可信度评估的有价值基准。

关键词

引用

@article{arxiv.2510.15232,
  title  = {FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain},
  author = {Tiansheng Hu and Tongyan Hu and Liuyang Bai and Yilun Zhao and Arman Cohan and Chen Zhao},
  journal= {arXiv preprint arXiv:2510.15232},
  year   = {2025}
}

备注

EMNLP 2025 Main