中文

语言模型的维度化与情境化评估框架 DICE

计算与语言 2025-04-15 v1 人机交互

摘要

语言模型(LM)正日益被集成到广泛的应用场景,但现代评估范式尚不充分地反映了它们的实际使用方式。当前的评估依赖的基准往往缺乏对实际部署情境的直接适用性。为弥合这一差距,我们提出了维度化与情境化评估(DICE)方法,对 LM 在细粒度、情境依赖维度上的表现进行评估。在本稿中,我们首先检视了现有 LM 基准的不足,突出其在现实应用场景中的有限适用性。随后,我们提出了一组细粒度评估参数,捕捉更贴近不同应用领域利益相关者所关心的 LM 行为维度。具体而言,我们引入情境无关参数——如鲁棒性、连贯性和认知诚实性——以及情境特定参数,这些参数必须针对具体情境约束和需求进行针对性调整。我们 then 讨论了实现这一评估框架的可能方法,最后阐述了 DICE 带来的机遇与挑战。最终,这项工作为情境特定且以利益相关者为导向的 LM 评估提供了实用且易于采纳的起点。

关键词

引用

@article{arxiv.2504.10359,
  title  = {DICE: A Framework for Dimensional and Contextual Evaluation of Language Models},
  author = {Aryan Shrivastava and Paula Akemi Aoyagui},
  journal= {arXiv preprint arXiv:2504.10359},
  year   = {2025}
}