LaQual:用于 LLM App 质量自动评估的新型框架
软件工程
2025-08-27 v1 人工智能
摘要
LLM app 商店正在快速涌现,作为收集基于 LLM 的各类智能应用程序的平台,为用户提供内容创建、编码支持、教育等多种选择。然而,当前用于排名和推荐 app 的方法主要依赖于用户活跃度和收藏等静态指标,使用户难以高效找到高质量的 app。为解决这些挑战,我们提出了 LaQual,一个用于评估 LLM app 质量的自动框架。LaQual 包含三个主要阶段:首先,对 LLM app 进行分层标注和分类,以准确匹配到不同情景;其次,使用静态指标(如时加权用户参与度和功能能力指标)筛选低质量 app;最后进行动态、情景自适应的评估,在该评估中,LLM 本身生成情景特定的评估指标、评分规则和任务,以进行全面质量评估。实验在流行的 LLM app 商店上进行,表明 LaQual 有效。其自动化得分在法律咨询情景(Spearman's rho 为 0.62,p=0.006)和旅行规划情景(rho 为 0.60,p=0.009)中与人类判断高度一致。通过有效筛选,LaQual 可将候选 LLM app 池减少 66.7% 到 81.3%。用户研究进一步表明,LaQual 在决策置信度、比较效率(平均得分 5.45 相对于 3.30)以及评估报告的感知价值(4.75 相对于 2.25)方面显著优于基线系统。总体而言,这些结果表明 LaQual 提供了一个可扩展、客观且以用户为中心的解决方案,用于在实际应用场景中查找和推荐高质量的 LLM app。
引用
@article{arxiv.2508.18636,
title = {LaQual: A Novel Framework for Automated Evaluation of LLM App Quality},
author = {Yan Wang and Xinyi Hou and Yanjie Zhao and Weiguo Lin and Haoyu Wang and Junjun Si},
journal= {arXiv preprint arXiv:2508.18636},
year = {2025}
}