SteerEval:推理时干预增强多语言神经摘要指标的多语言泛化能力
计算与语言
2026-01-23 v1
摘要
越来越多的研究利用多语言语言模型进行自然语言生成任务,例如摘要。该领域的一个主要经验瓶颈是缺乏针对许多语言的准确且鲁棒的评估指标,这阻碍了进展。最近的研究表明,多语言语言模型通常使用英语作为内部枢轴语言,而与此枢轴的不对齐可能导致下游性能下降。基于这种不匹配也可能适用于多语言神经指标的假设,我们探究了将其激活引导向英语枢轴是否能改善与人类判断的相关性。我们对基于编码器和解码器的指标进行了实验,发现测试时干预方法普遍有效,提高了针对多种语言的指标有效性。
引用
@article{arxiv.2601.15809,
title = {SteerEval: Inference-time Interventions Strengthen Multilingual Generalization in Neural Summarization Metrics},
author = {Silvia Casola and Ryan Soh-Eun Shim and Felicia Körner and Yuchen Mao and Barbara Plank},
journal= {arXiv preprint arXiv:2601.15809},
year = {2026}
}
备注
Submitted to ACL 2026