训练大语言模型识别自发性叙事中的模糊限制语
计算与语言
2024-08-07 v1 人工智能
摘要
模糊限制语使说话者能够将话语标记为临时性的,无论是用于表示非典型性或"模糊性",表示对某话语缺乏承诺,将陈述的责任归因于他人,邀请对方输入,还是为满足面子管理需求而缓和批评性反馈。在这里,我们聚焦于一个实验参数化语料库中自发性叙事里的模糊限制语,该语料库包含63个Roadrunner卡通叙事,由21位演讲者从记忆中自发产生,面向在场的听话者,并转录为文本(Galati and Brennan, 2010)。我们创建了由人工标注者标注的模糊限制语金标准(Roadrunner-Hedge语料库),并比较了三种基于LLM的模糊限制语检测方法:微调BERT,以及使用GPT-4o和LLaMA-3进行零样本和少样本提示。表现最佳的方法是微调BERT模型,其次是少样本GPT-4o。在对表现最佳的方法进行错误分析后,我们采用LLM-in-the-Loop方法改进了金标准标注,同时也突出了模糊限制语在语言上有趣地存在歧义的案例,这些案例将指导未来研究。这是我们研究计划的第一步,旨在训练大语言模型在对话中恰当且有意义地解释和生成辅助信号。
引用
@article{arxiv.2408.03319,
title = {Training LLMs to Recognize Hedges in Spontaneous Narratives},
author = {Amie J. Paige and Adil Soubki and John Murzaku and Owen Rambow and Susan E. Brennan},
journal= {arXiv preprint arXiv:2408.03319},
year = {2024}
}
备注
Amie Paige, Adil Soubki, and John Murzaku contributed equally to this study