FinTrust:面向金融领域的可信度评估综合基准
机器学习
2025-10-20 v1 计算与语言
摘要
最近的大型语言模型 (LLMs) 在解决金融相关问题方面展现出巨大的潜力。然而,由于其高风险和高风险属性,在实际金融应用中仍面临挑战。本文引入 FinTrust,一个专为评估金融领域 LLMs 可信度而设计的全面基准。我们的基准基于实际情境和特征,针对可信度评估的各个维度细化任务。我们在 FinTrust 上评估了十一个 LLMs,并发现专有模型如 o4-mini 在大多数任务(如安全性)中表现优异,而开源模型如 DeepSeek-V3 在特定领域(如行业层面公平性)中具有优势。对于像忠诚度对齐和披露这样的具挑战性的任务,所有 LLMs 都表现不足,显示出法律意识的显著差距。我们相信 FinTrust 可以是金融领域 LLMs 可信度评估的有价值基准。
引用
@article{arxiv.2510.15232,
title = {FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain},
author = {Tiansheng Hu and Tongyan Hu and Liuyang Bai and Yilun Zhao and Arman Cohan and Chen Zhao},
journal= {arXiv preprint arXiv:2510.15232},
year = {2025}
}
备注
EMNLP 2025 Main