中文

首尔韩语音高轮廓的深度监督对比学习及其在鲁棒音高重音分类中的应用

声音 2026-04-22 v1 计算与语言

摘要

首尔韩语的韵律结构在韵律音系学的自韵段-节律模型中由离散声调类别定义。然而,由于真实语音中 F0F_0 实现的可变性,将连续的 F0F_0 轮廓映射至这些不变类别极具挑战性。本文提出 Dual-Glob,一种深度监督对比学习框架,用于鲁棒地分类首尔韩语中的细粒度音高重音模式。不同于传统的局部预测模型,我们的方法通过在共享潜空间中强制干净视图与增强视图间的结构一致性,捕获了整体的 F0F_0 轮廓形状。为此,我们引入了首个大规模基准数据集,包含首尔韩语中 10,093 个手动标注的韵律短语。实验结果表明,我们的 Dual-Glob 显著优于强基线模型,实现了 SOTA 准确率(77.75%)和 F1 分数(51.54%)。因此,我们的工作利用数据驱动方法支持了基于 AM 的韵律音系学,表明深度对比学习能有效捕获连续 F0F_0 轮廓的整体结构特征。

关键词

引用

@article{arxiv.2604.19477,
  title  = {Deep Supervised Contrastive Learning of Pitch Contours for Robust Pitch Accent Classification in Seoul Korean},
  author = {Hyunjung Joo and GyeongTaek Lee},
  journal= {arXiv preprint arXiv:2604.19477},
  year   = {2026}
}