中文

大型语言模型作为非结构化文本数据评判器的潜力与风险

计算与语言 2025-01-22 v2 人工智能 计算机与社会

摘要

大型语言模型的快速发展为处理和总结非结构化文本数据开辟了显著的可能性。这对分析丰富的开放式数据集(如调查响应)具有重要意义,LLM 有望高效地提炼出关键主题和情感。在组织日益依赖这些强大 AI 系统来理解文本反馈的同时,一个关键问题浮现:我们能否信赖 LLM 对这些文本数据中所包含的视角进行准确的表征?尽管 LLM 在生成类人摘要方面表现出色,但其输出可能无意中偏离原始响应的真实内涵。LLM 生成的输出与数据中实际所呈现主题之间的差异,可能导致决策偏差,进而对组织产生深远影响。本研究探讨了 LLM 作为评判模型评估其他 LLM 生成摘要与文本数据中主题对齐程度的有效性。我们采用 Anthropic Claude 模型从开放式调查响应中生成主题摘要,Amazon Titan Express、Nova Pro 和 Meta Llama 则作为评判员。将这种 LLM 作为评判方法与人类评估进行比较,使用 Cohen's kappa、Spearman's rho 和 Krippendorff's alpha 进行验证,表明其是传统以人类为中心评估方法的可扩展替代方案。我们的发现表明,尽管 LLM 作为评判员提供了可与人类评判员相当的可扩展解决方案,但人类在检测细微、情境特定的细节方面仍具有优势。本研究为 AI 辅助文本分析的日益增长的知识体系作出了贡献。进一步,我们提供了针对未来研究的建议,强调在不同情境和用例中谨慎考虑将 LLM 作为评判模型进行推广的必要性。

关键词

引用

@article{arxiv.2501.08167,
  title  = {Potential and Perils of Large Language Models as Judges of Unstructured Textual Data},
  author = {Rewina Bedemariam and Natalie Perez and Sreyoshi Bhaduri and Satya Kapoor and Alex Gil and Elizabeth Conjar and Ikkei Itoku and David Theil and Aman Chadha and Naumaan Nayyar},
  journal= {arXiv preprint arXiv:2501.08167},
  year   = {2025}
}

备注

11 pages, 1 appendix