扩大 BERT 模型规模用于土耳其语自动标点与大小写纠正
计算与语言
2024-12-04 v1 人工智能
机器学习
摘要
本文探讨了基于 BERT 的模型在土耳其语文本中进行自动标点和大小写纠正方面的效果,研究了五种不同规模模型的表现。这些模型分别称为 Tiny、Mini、Small、Medium 和 Base。每个模型的设计和功能都针对土耳其语的特定挑战进行优化,旨在在提高性能的同时最小化计算开销。本研究系统比较了每个模型的精确率、召回率和 F1 分数,为模型在不同操作环境中的适用性提供了见解。结果表明,随着模型规模的增加,文本的可读性和准确性显著提高,Base 模型实现了最高的纠正精度。这项研究为根据具体用户需求和计算资源选择合适的模型规模提供了综合指南,为在实际应用中部署这些模型以提高书写土耳其语质量建立了框架。
引用
@article{arxiv.2412.02698,
title = {Scaling BERT Models for Turkish Automatic Punctuation and Capitalization Correction},
author = {Abdulkader Saoud and Mahmut Alomeyr and Himmet Toprak Kesgin and Mehmet Fatih Amasyali},
journal= {arXiv preprint arXiv:2412.02698},
year = {2024}
}
备注
2024 Innovations in Intelligent Systems and Applications Conference (ASYU)