KGCE:面向跨平台教育智能体基准测试的知识增强双图评估器
人工智能
2026-01-06 v1
摘要
随着多模态大语言模型 (MLM) 在自主智能体中的快速采用,教育场景下的跨平台任务执行能力已引起广泛关注。然而,现有基准框架在教育语境下支持跨平台任务仍存在显著缺陷,尤其是在处理学校专属软件(如 XiaoYa 智能助手、华视小子等)时,智能体效率常因缺乏对这些私有域软件结构细节的理解而显著下降。此外,当前评估方法高度依赖粗粒度指标,如目标导向或轨迹匹配,难以捕捉智能体在复杂任务中的详细执行情况和效率。为此,我们提出了 KGCE(Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models),这是一个集成知识库增强与双图评估框架的新型基准平台。我们首先构建了一个包含 104 个教育相关任务的数据集,覆盖 Windows、Android 和跨平台协作任务。KGCE 引入双图评估框架,将任务分解为多个子目标并验证其完成状态,从而提供细粒度评估指标。为克服现有智能体在私有域任务中的执行瓶颈,我们开发了一个集成特定学校软件知识库的增强智能体系统。代码可在 https://github.com/Kinginlife/KGCE 查阅。
引用
@article{arxiv.2601.01366,
title = {KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models},
author = {Zixian Liu and Sihao Liu and Yuqi Zhao},
journal= {arXiv preprint arXiv:2601.01366},
year = {2026}
}