超越二元:基于生成式预训练变换器和端到端模型的多类假发检测
计算与语言
2024-07-17 v1 声音
音频与语音处理
摘要
风痴是一种语言障碍,可能导致称为假发的语音错误,涉及词语的误用、替代或虚构。自动假发检测有助于患者,通过促进临床评估和治疗计划。然而,大多数自动假发检测工作仅关注二元检测,即识别假发的存在或缺失。多类假发检测代表了未探索的研究领域,侧重于识别给定语音片段中多种假发类型及其位置。我们提出了新方法,利用生成式预训练变换器(GPT)从转录文本中识别假发,另外两种端到端方法聚焦于同时建模自动语音识别(ASR)和假发分类,分别以多个序列与单个序列形式实现。我们证明,单序列模型在多类假发检测中优于GPT基线。
引用
@article{arxiv.2407.11345,
title = {Beyond Binary: Multiclass Paraphasia Detection with Generative Pretrained Transformers and End-to-End Models},
author = {Matthew Perez and Aneesha Sampath and Minxue Niu and Emily Mower Provost},
journal= {arXiv preprint arXiv:2407.11345},
year = {2024}
}