QualEval:面向模型改进的定性评估
机器学习
2024-05-07 v2 人工智能
计算与语言
摘要
量化评估指标历来在衡量人工智能系统(包括大语言模型,LLM)的进展中起着关键作用。然而,这些指标存在固有局限。鉴于真实世界任务的复杂性,用单一标量来量化和比较不足以捕捉模型行为的精细差异。指标仅作为比较和基准测试模型的方式,并不能产生可操作的诊断,从而使模型改进过程颇具挑战。模型开发者陷入大量人工劳动,包括筛选海量数据并尝试碰运气式地调整训练数据或设置。在本工作中,我们通过提出QualEval来解决量化指标的不足,该方法以自动化定性评估增强量化标量指标,作为模型改进的载体。QualEval使用强大的LLM推理器与我们新颖的灵活线性规划求解器来生成人类可读的洞察,应用这些洞察可加速模型改进。这些洞察由带有精细可视化和人类可解释分析的综合仪表板支撑。我们通过证明利用QualEval的洞察(例如)在具有挑战性的对话任务(DialogSum)上使Llama 2模型的绝对性能相较基线提升多达15个百分点,来证实QualEval的可靠性。QualEval成功提升了模型开发速度,本质上充当了“盒中数据科学家”。鉴于聚焦于批判和改进当前评估指标,我们的方法作为一种令人耳目一新的新技术,服务于模型评估与改进两者。
引用
@article{arxiv.2311.02807,
title = {QualEval: Qualitative Evaluation for Model Improvement},
author = {Vishvak Murahari and Ameet Deshpande and Peter Clark and Tanmay Rajpurohit and Ashish Sabharwal and Karthik Narasimhan and Ashwin Kalyan},
journal= {arXiv preprint arXiv:2311.02807},
year = {2024}
}
备注
NAACL 2024