中文

AI 是否能猜出你知道什么?大型语言模型用于从通信日志估计人类领域知识的性能比较

计算与语言 2026-05-25 v1 人机交互

摘要

员工往往难以识别 "谁知道什么",导致组织生产力损失。我们研究了大型语言模型(LLM)是否能够直接从长期 Slack 日志中推断出个体的领域知识。我们分析了来自 43 位用户的 27,188 条消息,评估了包括 Gemini、Claude 和 GPT 系列在内的七个模型,通过将它们的零样本估计值与 27 名参与者的自报告技能评分进行比较。Gemini 2.5 Flash 实现了最低的误差(MAE 21.13%),而 GPT 模型显示出显著更大的差异。值得注意的是,估计准确率仅 weakly 依赖于消息数量,这表明仅凭更多文本并不一定能获得更好的推断。这些发现表明了自动化知识图谱构建的可行性和当前限制,突显了需要隐私保护部署以及更丰富、结构感知的人类知识表示的重要性。

关键词

引用

@article{arxiv.2605.22971,
  title  = {Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs},
  author = {Ko Watanabe and Shoya Ishimaru},
  journal= {arXiv preprint arXiv:2605.22971},
  year   = {2026}
}