探究大型语言模型在从转录噪声语料中提取语法正确句子方面的能力
计算与语言
2024-10-08 v1
摘要
在处理噪声语料时有效地忽略语音特定元素,对人类而言并不构成重大挑战,因为人类展现出惊人的认知能力,能够将语义关键内容与语音特定噪声(即填充停顿、不连贯现象及重启)区分开来。这些能力可能基于已获取的语法规则机制,构成语料中抽象的句法-语义结构。结构中不包含句法与语义意义的片段被一致地忽略。这些结构与词汇共同构成语言理解的基础,从而促进有效的交流。我们在以语言学为基础的实验中探讨大型语言模型(LLM)是否能有效执行类比语音理解任务。具体而言,我们检验LLM从语音对话转录中提取结构良好语料的能力。我们在波兰语场景中进行两种评估实验,使用一个可能未被LLM熟知的数据集以缓解数据污染风险。我们的结果表明,并非所有提取的语料都正确构成,表明LLM或许未完全获取句法-语义规则,或获取了但未能有效应用。我们得出结论,LLM处理噪声语料的能力在与人类处理能力相比时仍相对浅显。
引用
@article{arxiv.2410.05099,
title = {Investigating large language models for their competence in extracting grammatically sound sentences from transcribed noisy utterances},
author = {Alina Wróblewska},
journal= {arXiv preprint arXiv:2410.05099},
year = {2024}
}
备注
Accepted at CoNLL 2024