为马来西亚语文本适配安全工作分类器:增强 LLM-Ops 框架中的对齐
计算与语言
2024-07-31 v1
摘要
随着大型语言模型(LLM)越来越多地集成到操作工作流(LLM-Ops)中,迫切需要有效的护栏来确保安全和对齐的交互,包括检测跨语言潜在不安全或不当内容的能力。然而,现有的安全工作分类器主要关注英语文本。为了解决马来西亚语的这一差距,我们提出了一种专门为马来西亚语内容定制的新型安全工作文本分类器。通过整理和标注一个涵盖多个内容类别的首个此类马来西亚语文本数据集,我们训练了一个分类模型,能够使用最先进的自然语言处理技术识别潜在的不安全材料。这项工作代表了在实现更安全的交互和内容过滤方面迈出的重要一步,以减轻潜在风险并确保 LLM 的负责任部署。为了最大限度地提高可访问性并促进进一步研究,以增强马来西亚语境下 LLM-Ops 的对齐,该模型已在 https://huggingface.co/malaysia-ai/malaysian-sfw-classifier 公开发布。
引用
@article{arxiv.2407.20729,
title = {Adapting Safe-for-Work Classifier for Malaysian Language Text: Enhancing Alignment in LLM-Ops Framework},
author = {Aisyah Razak and Ariff Nazhan and Kamarul Adha and Wan Adzhar Faiq Adzlan and Mas Aisyah Ahmad and Ammar Azman},
journal= {arXiv preprint arXiv:2407.20729},
year = {2024}
}