利用合成数据在语音转文本转录中进行地址提取的命名实体识别
计算与语言
2024-02-09 v1
摘要
本文介绍了一种基于双向编码器表示变换器(BERT)架构的命名实体识别(NER)模型构建方法,具体使用了 SlovakBERT 模型。该 NER 模型从语音转文本转录获取的数据中提取地址部分。由于真实数据稀缺,我们使用 GPT API 生成了一个合成数据集。本文强调了在这种人工数据中模拟口语变异性的重要性。我们使用一个小的真实测试数据集,评估了仅用合成数据训练的 NER 模型的性能。
引用
@article{arxiv.2402.05545,
title = {Named Entity Recognition for Address Extraction in Speech-to-Text Transcriptions Using Synthetic Data},
author = {Bibiána Lajčinová and Patrik Valábek and Michal Spišiak},
journal= {arXiv preprint arXiv:2402.05545},
year = {2024}
}