中文

从绩效到目的:评估大型语言模型实用性的社会技术分类框架

计算与语言 2026-02-25 v1

摘要

随着大型语言模型(LLM)在完成离散任务方面的持续提升,它们被集成到日益复杂和多样的实际系统中。然而,仅凭任务级成功并不足以确定模型在实际应用中的适配性。在应用场景中,LLM的有效性受到超越常规性能衡量标准的更广泛社会技术因素的驱动。尽管存在一组不断增长的指标捕捉了许多这些考虑因素,但它们很少以支持一致评估的方式进行组织,缺乏一种统一的分类框架用于评估和比较跨用例的LLM实用性。为填补这一空白,我们引入了语言模型实用性分类框架(Language Model Utility Taxonomy, LUX),该框架结构化了跨四个领域的实用性评估:性能、交互、运营和治理。在每个领域中,LUX按主题对齐的维度和组件进行层次化组织,每个组件都以可实现定量比较和与意图用途相匹配的模型选择为依据。此外,提供了一个外部动态网页工具,以支持框架的探索,通过将每个组件连接到相关指标(因素)的存储库来支持实际评估。

关键词

引用

@article{arxiv.2602.20513,
  title  = {From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility},
  author = {Gavin Levinson and Keith Feldman},
  journal= {arXiv preprint arXiv:2602.20513},
  year   = {2026}
}