基于大语言模型与原型导向预测管道的乌尔德语意图检测提升
计算与语言
2025-05-14 v1 人工智能
摘要
多种意图检测预测器已用于不同语言,包括英语、中文和法语,但乌尔德语(全球第十大语言)的该领域发展不足。在知名语言中,意图检测预测器采用零样本学习策略,基于模型在所见类别上的训练来预测未见类别。然而,乌尔德语缺乏基于零样本策略的意图检测预测器,传统预测器仅针对模型训练中出现的相同类别进行预测。为赋能乌尔德语专属意图检测,本文引入一种独特的对比学习方法,利用未标记的乌尔德语数据重新训练预训练语言模型。该重新训练使大语言模型(LLM)在下游意图检测任务中获得表征学习能力。最终,我们将预训练LLM的潜力与原型导向注意力机制相结合,构建一个综合性的端到端LLMPIA意图检测管道。在该预测管道范式下,我们探索了6种不同语言模型和13种不同相似度计算方法的潜力。该框架在2个公共基准数据集上进行评估,即ATIS包含5836个样本,Web Queries包含8519个样本。在ATIS数据集下进行4向1 shot和4向5 shot实验设置时,LLMPIA分别实现了83.28%和98.25%的F1得分;在Web Queries数据集上分别达到76.23%和84.42%的F1得分。在Web Queries数据集的额外案例研究中,在相同类别的训练和测试集设置下,LLMPIA超越最先进的预测器53.55%的F1得分。
引用
@article{arxiv.2505.07857,
title = {Enhanced Urdu Intent Detection with Large Language Models and Prototype-Informed Predictive Pipelines},
author = {Faiza Hassan and Summra Saleem and Kashif Javed and Muhammad Nabeel Asim and Abdur Rehman and Andreas Dengel},
journal= {arXiv preprint arXiv:2505.07857},
year = {2025}
}
备注
42 pages, 10 figures(including 6 graphs)