评估大型语言模型在太空任务团队互动中检测微行为的可行性
计算与语言
2025-07-01 v1
摘要
我们探讨了大型语言模型(LLM)在检测太空任务模拟中团队对话中细微微行为表达的可行性。具体而言,我们检验了基于编码器的序列分类LLM的零样本分类、微调和改写增强微调,以及基于解码器的因果语言模型LLM的少样本文本生成,以预测每段对话关联的微行为。我们的发现表明,编码器类LLM(如RoBERTa和DistilBERT)在检测被低估的微行为方面表现不佳,尤其是打压性言论,即使进行加权微调也难以克服。相比之下,经过指令微调的Llama-3.1(一种解码器类LLM)表现卓越,最佳模型在3类分类中实现44%的宏平均F1分数,在二分类中实现68%。这些结果对开发旨在分析团队沟通动态并增强高风险环境(如太空任务)中培训干预的语音技术具有意义,尤其是在仅能获取文本数据的情景下。
引用
@article{arxiv.2506.22679,
title = {Assessing the feasibility of Large Language Models for detecting micro-behaviors in team interactions during space missions},
author = {Ankush Raut and Projna Paromita and Sydney Begerowski and Suzanne Bell and Theodora Chaspari},
journal= {arXiv preprint arXiv:2506.22679},
year = {2025}
}
备注
5 pages, 4 figures. Accepted to Interspeech 2025