面向多模态作文评分的决策级序数建模
计算与语言
2026-03-17 v1 人工智能
摘要
自动作文评分(AES)预测每个作文对应的多个评卷标准得分,其中每个标准遵循有序离散评分尺度。大多数基于大语言模型的 AES 方法将评分建模为自回归标记生成,通过解码和解析获得最终得分,使决策过程隐式化。这一表述在多模态 AES 中尤为敏感,因为视觉输入在不同作文和标准之间可用性差异大。为此,我们提出决策级序数建模(DLOM),通过复用语言模型头部在预定义评分标记上提取得分相关 logits,使评分成为显式的序数决策,直接在得分空间中进行优化和分析。对于多模态 AES,DLOM-GF 引入门控融合模块,自适应组合文本和多模态得分 logits。对于文本-only AES,DLOM-DA 添加距离感知正则化项,以更好地反映序数距离。实验表明,在多模态 EssayJudge 数据集上,DLOM 在各评分标准上均优于基于生成的 SFT 基线,DLOM-GF 在模态相关性异构时进一步获得提升。在文本-only ASAP/ASAP++ 基准上,DLOM 无需视觉输入即可保持有效,DLOM-DA 进一步提升性能,并超越强有力的代表性基线。
引用
@article{arxiv.2603.14891,
title = {Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models},
author = {Han Zhang and Jiamin Su and Li liu},
journal= {arXiv preprint arXiv:2603.14891},
year = {2026}
}