HuAMR:匈牙利 AMR 解析器与数据集
计算与语言
2025-03-03 v1
摘要
我们提出 HuAMR,即首个面向匈牙利语的抽象意义表示(Abstract Meaning Representation, AMR)数据集及一套基于大型语言模型的 AMR 解析器,旨在缓解非英语语言语义资源稀缺的局面。为创建 HuAMR,我们采用 Llama-3.1-70B 自动生成银标准 AMR 标注,并通过人工校准以确保数据质量。基于该数据集,我们探讨了不同的模型架构——mT5 Large 和 Llama-3.2-1B ——以及微调策略对 AMR 解析性能的影响。虽然将 Llama-3.1-70B 生成的银标准 AMR 纳入更小模型的训练数据并不始终提升整体得分,但我们的实验表明,这些技术有效提升了针对匈牙利新闻数据(HuAMR 数据集的领域)的解析准确率。我们使用 Smatch 分数对解析器进行评估,并确认了 HuAMR 及我们解析器在推动语义解析研究方面的潜力。
引用
@article{arxiv.2502.20552,
title = {HuAMR: A Hungarian AMR Parser and Dataset},
author = {Botond Barta and Endre Hamerlik and Milán Konor Nyist and Judit Ács},
journal= {arXiv preprint arXiv:2502.20552},
year = {2025}
}