MeetBench-XL:面向实时会议的校准多维度评估与学习双策略代理
人工智能
2026-02-04 v1
摘要
企业会议环境需要能够处理多样化运营任务的AI助手,从而在严格的延迟、成本和隐私约束下,支持实时事实核查、跨会议分析等战略规划。现有会议基准主要关注简化问答,无法反映企业工作流程中真实场景:查询源于多利益相关者协作,跨越长时间上下文,需依赖工具增强推理。我们通过扎实数据集和学习代理框架来填补这一空白。首先,我们引入MeetAll,一个源自231场企业会议(总时长140小时)的双语多模态语料库。采用经企业验证的协议注入问题,经领域专家审核和人类判别性研究验证。与纯合成基准不同,本协议基于四个企业关键维度:认知负荷、时间上下文跨度、领域专业性和可操作任务执行,通过访谈金融、 healthcare和technology部门的利益相关者进行校准。其次,我们提出MeetBench XL,一个多维度评估协议,与人类判断一致,衡量事实忠实度、意图对齐、响应效率、结构清晰度和完整性。最后,我们 presenting MeetMaster XL,一个学习双策略代理,联合优化查询路由在快速与慢速推理路径之间以及工具调用,包括检索、跨会议聚合和网络搜索。轻量级分类器实现精准路由,开销最小,超越单一模型基线在质量-延迟权衡上取得优势。针对商业系统的实验显示持续提升,辅以消融实验、鲁棒性测试和真实世界部署案例研究。资源:https://github.com/huyuelin/MeetBench。
引用
@article{arxiv.2602.03285,
title = {MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings},
author = {Yuelin Hu and Jun Xu and Bingcong Lu and Zhengxue Cheng and Hongwei Hu and Ronghua Wu and Li Song},
journal= {arXiv preprint arXiv:2602.03285},
year = {2026}
}
备注
accepted by AAAI2026 ws