构建面向银行应用CS对话系统的NLU数据生成的韩语语言资源
计算与语言
2026-05-12 v1 机器学习
摘要
自然语言理解(NLU)是面向任务导向对话系统的关键组成部分,但需要大量标注训练数据以覆盖多样化说话utterances。本研究报告了构建名为FIAD(Financial Annotated Dataset)的语言资源及其用于生成韩语标注训练数据的用途。通过对银行应用评论语料库的实证检验,我们识别出韩语请求语句中出现的三个语言模式:TOPIC(ENTITY、FEATURE)、EVENT和DISCOURSE MARKER。我们将其表示为LGGs(Local Grammar Graphs),以生成覆盖多样化意图和实体的标注数据。为评估该资源的实用性,我们评估了DIET-only(意图:0.91 /主题[实体+特征]:0.83)、DIET+HANBERT(I:0.94/T:0.85)、DIET+KoBERT(I:0.94/T:0.86)和DIET+KorBERT(I:0.95/T:0.84)模型在FIAD生成的数据上提取各种语义项目的性能。
引用
@article{arxiv.2605.10241,
title = {Building Korean linguistic resource for NLU data generation of banking app CS dialog system},
author = {Jeongwoo Yoon and On-yu Park and Changhoe Hwang and Gwanghoon Yoo and Eric Laporte and Jeesun Nam},
journal= {arXiv preprint arXiv:2605.10241},
year = {2026}
}