中文

相同声明,不同判断:多语言金融虚假信息检测中场景诱导偏差的基准测试

计算与语言 2026-04-21 v2

摘要

大型语言模型 (LLM) 已广泛应用于金融的各个领域。由于其训练数据主要来源于人类编写的语料库,LLM 可能会继承一系列人类偏差。行为偏差会导致决策的不稳定性和不确定性,特别是在处理金融信息时。然而,现有关于 LLM 偏差的研究主要集中在直接提问或简化的通用设置上,对复杂的现实世界金融环境以及高风险、上下文敏感的多语言金融虚假信息检测任务 (MFMD) 的考虑有限。在这项工作中,我们提出了 MFMDScen,这是一个用于评估 LLM 在不同经济场景下 MFMD 中行为偏差的综合基准。我们与金融专家合作,构建了三种类型的复杂金融场景:(i) 基于角色和人格的,(ii) 基于角色和地区的,以及 (iii) 包含种族和宗教信仰的基于角色的场景。我们进一步开发了一个涵盖英语、中文、希腊语和孟加拉语的多语言金融虚假信息数据集。通过将这些场景与虚假信息声明相结合,MFMDScen 能够对 22 个主流 LLM 进行系统评估。我们的研究结果表明,在商业和开源模型中都持续存在显著的行为偏差。该项目可在 https://github.com/lzw108/FMD 获取。

关键词

引用

@article{arxiv.2601.05403,
  title  = {Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection},
  author = {Zhiwei Liu and Yupen Cao and Yuechen Jiang and Mohsinul Kabir and Polydoros Giannouris and Chen Xu and Ziyang Xu and Tianlei Zhu and Md. Tariquzzaman and Triantafillos Papadopoulos and Yan Wang and Lingfei Qian and Xueqing Peng and Zhuohan Xie and Ye Yuan and Saeed Almheiri and Abdulrazzaq Alnajjar and Mingbin Chen and Harry Stuart and Paul Thompson and Prayag Tiwari and Alejandro Lopez-Lira and Xue Liu and Jimin Huang and Sophia Ananiadou},
  journal= {arXiv preprint arXiv:2601.05403},
  year   = {2026}
}