基于AI的创新测量:将专家洞见映射到大语言模型应用中
计算与语言
2025-08-05 v1
摘要
创新测量通常依赖于特定情境的代理指标和专家评估。因此,经验性创新研究常局限于数据可得的情境。我们探讨了如何利用大语言模型(LLM)来克服手动专家评估的限制,帮助研究人员测量创新。我们设计了一个可靠地近似领域专家对创新的评估框架,从非结构化文本数据中实现这一目标。我们通过两个不同情境的研究展示了该框架的性能和广泛适用性:(1)软件应用更新的创新性,(2)用户生成反馈和改进想法的原创性。我们将该LLM框架的F1分数和可靠性(一致性率)与先前创新研究中使用的替代措施、以及最先进的机器学习和深度学习模型进行比较。该LLM框架的F1分数高于其他方法,且其结果高度一致(即结果在不同运行中保持不变)。本文为企业内的R&D人员、研究人员、评审员和编辑人员提供了有效利用LLM进行创新测量和评估LLM基于创新措施性能的知识与工具。通过这一过程,我们讨论了包括模型选择、提示工程、训练数据规模、训练数据分布以及参数设置等重要设计决策对性能和可靠性的影响。鉴于使用人类专家评估和现有文本基准方法所固有的挑战,该框架在利用LLM作为可靠、越来越易于获取且越来越广泛适用的创新测量工具方面具有重要意义。
引用
@article{arxiv.2508.02430,
title = {AI-Based Measurement of Innovation: Mapping Expert Insight into Large Language Model Applications},
author = {Robin Nowak and Patrick Figge and Carolin Haeussler},
journal= {arXiv preprint arXiv:2508.02430},
year = {2025}
}