ANLS* -- 面向生成式大语言模型的通用文档处理评估指标
计算与语言
2025-04-23 v9 人工智能
摘要
传统上,判别式模型一直是文档分类和信息抽取等任务的首选。这些模型的预测结果属于有限数量的预定义类别,便于进行二元真/假评估,并能直接计算 F1 分数等指标。然而,生成式大语言模型(GLLMs)的最新进展促使该领域发生了转变,因为它们增强了零样本能力,消除了对下游数据集和计算昂贵的微调的需求。然而,评估 GLLMs 面临挑战,因为用于判别式模型的二元真/假评估不适用于 GLLMs 做出的预测。本文引入了一种名为 ANLS* 的生成模型新指标,用于评估包括信息抽取和分类任务在内的各种任务。ANLS* 指标扩展了现有的 ANLS 指标,可作为直接替代品,并且仍与先前报告的 ANLS 分数兼容。我们还提供了使用 ANLS* 指标对 7 个不同数据集、20 多种不同 GLLMs 以及 3 种不同提示方法的评估,展示了所提指标的重要性。我们还将一种称为 SFT 的生成文档提示的新方法与 LATIN 等其他提示技术进行了基准测试。在几乎所有情况下,SFT 的表现都优于其他技术并提升了最先进水平(SOTA),有时提升幅度高达 个百分点。源代码可在 https://github.com/deepopinion/anls_star_metric 获取。
引用
@article{arxiv.2402.03848,
title = {ANLS* -- A Universal Document Processing Metric for Generative Large Language Models},
author = {David Peer and Philemon Schöpf and Volckmar Nebendahl and Alexander Rietzler and Sebastian Stabinger},
journal= {arXiv preprint arXiv:2402.03848},
year = {2025}
}