超越一致性:基于语言学反事实的自动作文评分方法理由对齐诊断
计算与语言
2024-10-10 v2
摘要
尽管当前的自动作文评分(AES)方法与人类评分者表现出高度的一致性,但其决策机制尚未完全理解。我们提出的方法利用大型语言模型(LLMs)辅助的反事实干预,揭示了BERT类模型主要关注句子级特征,而GPT-3.5、GPT-4和Llama-3等LLMs对规范与准确性、语言复杂性和组织敏感,表明与评分标准有更全面的理由对齐。此外,LLMs在给出作文反馈时能够辨别反事实干预。我们的方法提高了对神经AES方法的理解,也可应用于其他寻求模型驱动决策透明度的领域。
引用
@article{arxiv.2405.19433,
title = {Beyond Agreement: Diagnosing the Rationale Alignment of Automated Essay Scoring Methods based on Linguistically-informed Counterfactuals},
author = {Yupei Wang and Renfen Hu and Zhe Zhao},
journal= {arXiv preprint arXiv:2405.19433},
year = {2024}
}