中文

评估基于可复用跨域管道的 AI 会议摘要

人工智能 2026-05-14 v2 计算与语言

摘要

工业团队常在稳定的回归或模型选择评估存在之前便部署大型语言模型功能。我们提出了一个用于评估 AI 会议摘要的可复用评估系统,集成了结构化真实值(ground-truth, GT)构建、固定候选生成、主张导向评分、持久化报告以及隐私受限的在线监控和提名接口。该在线证据本身并非基准:隐私安全的聚合导出显示主动监控、硬性情景检测及方向性变化,却未暴露客户数据。我们在114场会议上对离线路径进行基准测试,涵盖city_council、private_data和whitehouse_press_briefings三类场景,得到340组会议-模型配对和680次gpt-4.1-mini、gpt-5-mini和gpt-5.1的评判运行。在固定协议下,准确率差异在Holm校正下并不显著(校正后p值0.053-0.448),尽管gpt-4.1-mini在平均准确率上最高(0.583);在保留率上,gpt-5.1在完整性(0.886)和覆盖率(0.942)方面显著领先。类型化切片将whitehouse_press_briefings识别为准确率硬性情景,后续对gpt-4.1、gpt-5-mini和gpt-5.4的专项重跑重用同一套栈、相同的评判员和指标。该扩展预印本维持核心结果与正式提交的一致,同时添加了来自伴随AI搜索论文的跨域复用详细存储库层面账户,以及额外的类型化DeepEval对比分析。模型命名说明。正文中首次引入模型名称时使用规范名称。表格、文件名和制品ID保留紧凑报告标签,以保持与打包基准输出的一致性。表A映射两种约定,在第4.3节定义候选生成设置时予以重复。

关键词

引用

@article{arxiv.2604.21345,
  title  = {Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline},
  author = {Philip Zhong and Don Wang and Jason Zhang},
  journal= {arXiv preprint arXiv:2604.21345},
  year   = {2026}
}

备注

AI Application Feature Quality Evaluation (28 pages total)