中文

基于语义检索的少样本提示语音事件抽取

计算与语言 2025-09-30 v1 人工智能

摘要

语音事件抽取(Speech Event Extraction, SpeechEE)是一项具有挑战性的任务,位于自动语音识别(Automatic Speech Recognition, ASR)和自然语言处理(Natural Language Processing, NLP)的交叉领域,需要从语音语言中识别结构化事件信息。在本工作中,我们提出了一种模块化、基于管道的 SpeechEE 框架,将高性能 ASR 与语义搜索增强的大语言模型(Large Language Model, LLM)提示相结合。我们的系统首先使用包含基于规则、BERT 基于和 LLM 基于模型的混合过滤机制对可能包含事件的语音片段进行分类。然后,通过语义相似性检索动态丰富的少样本 LLM 提示,用于识别事件触发器并提取相应参数。我们使用多个 LLM(Llama3-8B、GPT-4o-mini 和 o1-mini)进行评估,突出显示 o1-mini 在事件触发器分类上达到 63.3% 的 F1 分数,在参数分类上达到 27.8% 的 F1 分数,超越了现有基准。我们的结果表明,尽管保持可解释性和模块化,管道方法在由检索增强的 LLM 提供支持时,可以与或超过端到端系统。本工作为 LLM 驱动的事件抽取提供了实用见解,为未来结合文本和声学特征的混合模型开辟了道路。

关键词

引用

@article{arxiv.2504.21372,
  title  = {Retrieval-Enhanced Few-Shot Prompting for Speech Event Extraction},
  author = {Máté Gedeon},
  journal= {arXiv preprint arXiv:2504.21372},
  year   = {2025}
}