商业想法评估中的综合评判与个性化评判:来自专家不一致的证据
计算与语言
2026-04-27 v1
摘要
评估 LLM 生成的商业想法往往比生成它们更难扩展。不同于标准 NLP 基准,商业想法评估依赖于可行性、新颖性、差异化、用户需求和市场规模等多维准则,且专家判断常常不一致。本文研究了此类不一致所提出的方法论问题:自动评判器应模拟综合共识,还是建模个体评估者?我们引入 PBIG-DATA 数据集,包含约 3,000 项针对 300 个以专利为基础的产品想法的个体评分,由领域专家在六个商业维度上打分:具体性、技术有效性、创新性、竞争优势、需求有效性和市场规模。分析表明,在细粒度的有序评分上,专家之间存在显著的 disagreement,而在粗糙选择下,一致性更高,这表明是结构化的异构性而非随机噪声。随后我们比较了三种评判器配置:一种基于 rubric 的零样本评判器、一种基于混合评估者历史条件的综合评判器,以及一种基于目标评估者评分历史条件的个性化评判器。在各维度和模型规模下,个性化评判器与相应评估者的一致性更高,而评估者之间的一致性仅在个性化条件下与评判器生成的推理相似性相关。这些结果表明,在多元评估环境中,汇合标签可能是脆弱的目标,动力在商业想法评估中动员面向评估者的评判器设计。
引用
@article{arxiv.2604.22517,
title = {Aggregate vs. Personalized Judges in Business Idea Evaluation: Evidence from Expert Disagreement},
author = {Wataru Hirota and Tomoki Taniguchi and Tomoko Ohkuma and Kosuke Takahashi and Takahiro Omi and Kosuke Arima and Takuto Asakura and Chung-Chi Chen and Tatsuya Ishigaki},
journal= {arXiv preprint arXiv:2604.22517},
year = {2026}
}
备注
ACL 2026 Industry Track (Oral)