COINBench: 超越单一视角的集体意图理解
信息检索
2026-03-24 v1 人工智能
摘要
理解人类意图是大语言模型(LLM)的一个高级认知挑战,需要对噪声、冲突和非线性话语进行精细推理。尽管LLM在遵循单个指令方面表现出色,但在从多源公共讨论中提取共识、解决矛盾并推断潜在趋势的集体意图方面仍鲜有探索。为弥合这一差距,我们引入COIN-BENCH,一个动态的、真实的、实时更新的基准,专为评估LLM在消费领域的集体意图理解而设计。不同于关注交易性结果的传统基准,COIN-BENCH将意图操作化为分层认知结构,涵盖从明确情景到深层因果推理。我们实现了一个健壮的评估管道,结合基于规则的方法与LLM评判方法。该框架集成了COIN-TREE用于分层认知结构化与检索,以及COIN-RAG以确保对原始集体人类讨论实现专业级精度。对20个最先进LLM在四个维度上的广泛评估——深度、广度、信息量和正确性——揭示了尽管当前模型能够处理表层聚合,但在复杂意图综合所需的分析深度方面仍存在挑战。COIN-BENCH确立了推动LLM从被动指令跟随者转变为能够解读真实世界集体之声的专家级分析代理的新标准。
引用
@article{arxiv.2603.21329,
title = {COINBench: Moving Beyond Individual Perspectives to Collective Intent Understanding},
author = {Xiaozhe Li and Tianyi Lyu and Siyi Yang and Yizhao Yang and Yuxi Gong and Jinxuan Huang and Ligao Zhang and Zhuoyi Huang and Qingwen Liu},
journal= {arXiv preprint arXiv:2603.21329},
year = {2026}
}