使用微调大型语言模型对模糊意图攻击问卷进行自动评分
物理学史与哲学
2025-08-15 v1
摘要
敌意归因偏差是将社交互动解释为有意攻击性的倾向。模糊意图攻击问卷(AIHQ)是常用于测量敌意归因偏差的工具,包含开放式问题,询问参与者对负面社交情境中意图的感知以及他们的应对方式。虽然这些问题提供了关于敌意归因内容的见解,但需要人类评分者进行耗时的评分。在本研究中,我们评估了大型语言模型是否能够自动对 AIHQ 的开放式回答进行评分。我们使用了之前收集的包含创伤性脑损伤(TBI)患者和健康对照(HC)的 AIHQ 数据集,后者的开放式回答由受训的人类评分者进行了评分。我们使用其中一半回答来微调两种模型,以学习人类生成的评分,并在剩余的一半 AIHQ 回答上进行测试。结果表明,模型生成的评分与人类评分在对攻击性归因和攻击性应对方面均高度一致,微调后的模型显示出更高的一致性。这一一致性在模糊、有意图和意外情境类型中均得到复制,并复制了 TBI 和 HC 组在攻击性归因和攻击性应对方面存在的群体差异的先前发现。微调后的模型也对独立的非临床数据集表现出良好的泛化。为支持更广泛的采用,我们提供了一个易于使用的评分界面,包括本地和云端选项。总体而言,我们的发现表明,大型语言模型可以加速 AIHQ 在研究和临床情境中的评分,揭示了其在不同人群中促进心理评估的潜力。
引用
@article{arxiv.2508.10006,
title = {On something and nothing: The interface of two types of nothing},
author = {Adam Brownstein},
journal= {arXiv preprint arXiv:2508.10006},
year = {2025}
}