IndoBERT-Relevancy:面向印尼文本的上下文条件相关性分类器
计算与语言
2026-03-30 v1
摘要
判断一段文本是否与给定主题相关是自然语言处理中的基础任务,但针对印度尼西亚语(Bahasa Indonesia)的研究仍 largely unexplored。与情感分析或命名实体识别不同,相关性分类要求模型同时对两个输入进行推理:一个主题上下文和一个候选文本。我们提出IndoBERT-Relevancy,一个基于IndoBERT Large(3.35亿参数)构建的上下文条件相关性分类器,在涵盖188个主题的新标注数据集(31,360个标注对)上训练。通过迭代的、基于失败的数据构建过程,我们证明单一数据源不足以实现鲁棒的相关性分类,而针对性的合成数据可以有效解决模型的特定弱点。最终模型在F1分数上达到0.948,准确率达到96.5%,能够处理正式和非正式的印尼文本。该模型在HuggingFace上公开发布。
引用
@article{arxiv.2603.26095,
title = {IndoBERT-Relevancy: A Context-Conditioned Relevancy Classifier for Indonesian Text},
author = {Muhammad Apriandito Arya Saputra and Andry Alamsyah and Dian Puteri Ramadhani and Thomhert Suprapto Siadari and Hanif Fakhrurroja},
journal= {arXiv preprint arXiv:2603.26095},
year = {2026}
}
备注
9 pages, 3 figures,6 tables