中文

基于大语言模型的金融沟通中论证质量标注与性别偏见检测

计算与语言 2025-08-13 v1

摘要

金融论证在塑造投资决策和公众对金融机构的信任方面起着关键作用。然而,对其质量的评估在文献中研究甚少。本文利用FinArgQuality数据集,考察了三种最先进的大语言模型(LLM)——GPT-4o、Llama 3.1和Gemma 2——在金融沟通中标注论证质量的能力。我们的贡献有两点。首先,我们评估了LLM生成的标注在多次运行中的一致性,并将其与人工标注进行基准比较。其次,我们引入了一种旨在注入性别偏见的对抗性攻击,以分析模型的响应并确保模型的公平性和鲁棒性。两项实验均在三种温度设置下进行,以评估它们对标注稳定性和与人类标签一致性的影响。我们的研究结果表明,基于LLM的标注在标注者间一致性上高于人类标注者,尽管这些模型仍表现出不同程度的性别偏见。我们对这些结果进行了多维度分析,并提供了实用建议,以指导未来研究朝着更可靠、更具成本效益且具有偏见意识的标注方法发展。

关键词

引用

@article{arxiv.2508.08262,
  title  = {Argument Quality Annotation and Gender Bias Detection in Financial Communication through Large Language Models},
  author = {Alaa Alhamzeh and Mays Al Rebdawi},
  journal= {arXiv preprint arXiv:2508.08262},
  year   = {2025}
}

备注

8 pages, 4 figures, Passau uni, Master thesis in NLP