中文

LLM 辅助的对话数据自动演绎编码:利用对话特性提升情境理解

计算与语言 2025-04-29 v1 社会与信息网络

摘要

对话数据是理解学习过程的关键来源,提供了关于学生如何参与协作讨论以及这些互动如何塑造其知识构建的重要见解。大型语言模型(LLMs)的出现为推进定性研究提供了前景,尤其是在对话数据的自动编码方面。然而,对话的内在情境复杂度为这些模型带来了独特的挑战,尤其是在理解和解释复杂情境信息方面。本文通过开发一种新的 LLM 辅助的对话数据自动编码方法来应对这些挑战。我们提出的方法框架具有三方面的新颖性:1) 我们基于对话特性——交际行为和交际事件——使用独立的提示词(遵循角色提示和链式思维方法)来预测话语的编码;2) 我们邀请了包括 GPT-4-turbo、GPT-4o、DeepSeek 在内的多个 LLM 进行协作预测;3) 我们利用事件与行为之间的相互关系,通过 GPT-4o 实现一致性检查。特别是,我们的情境一致性检查显著提高了准确率。我们还发现,行为预测的准确率始终高于事件预测的准确率。这一研究为增强对话数据自动编码的精度提供了新的方法论框架,也为解决对话分析中固有的情境挑战提供了可扩展的解决方案。

关键词

引用

@article{arxiv.2504.19734,
  title  = {LLM-Assisted Automated Deductive Coding of Dialogue Data: Leveraging Dialogue-Specific Characteristics to Enhance Contextual Understanding},
  author = {Ying Na and Shihui Feng},
  journal= {arXiv preprint arXiv:2504.19734},
  year   = {2025}
}