自动化多场面试(MMI)评分
计算与语言
2026-02-03 v1
摘要
评估如同理心、伦理判断和沟通能力等软技能对于竞争性选择过程至关重要,但人类评分往往不一致且存在偏见。虽然大型语言模型(Large Language Models, LLMs)在自动作文评分(Automated Essay Scoring, AES)方面取得了进展,但我们发现基于理由的精调方法在处理 Multiple Mini-Interviews(MMIs)这一抽象且依赖情境的任务时,难以捕捉候选叙事中潜在的信号。我们引入一种多智能体提示框架,将评估过程分解为 transcript 细化和基于标准的评分。使用 3-shot in-context learning with a large instruct-tuned model,我们的方法在 specialized fine-tuned baselines(平均 QWK 0.62 vs 0.32)上取得优势,并实现了与人类专家相当的可靠性。我们进一步在 ASAP benchmark 上展示了该框架的可泛化性,其中它在无需额外训练的情况下,与特定领域的 state-of-the-art 模型一应相等。这一发现表明,对于复杂且主观的推理任务,结构化提示工程可能为数据密集型精调提供可扩展的替代方案,改变了 LLMs 在自动评估中的应用方式。
引用
@article{arxiv.2602.02360,
title = {Automated Multiple Mini Interview (MMI) Scoring},
author = {Ryan Huynh and Frank Guerin and Alison Callwood},
journal= {arXiv preprint arXiv:2602.02360},
year = {2026}
}
备注
18 pages, 2 figures