中文

通过贝塞斯模型实现与乌萨斯口语的对话式AI:数据集与混合模型的数字包容

计算与语言 2025-09-19 v1 人工智能

摘要

非洲语言在自然语言处理(NLP)领域仍严重不足,大多数语料库仅限于正式语料,无法捕捉日常交流的活力。本工作针对乌萨斯语——一种在赞比亚和赞桑地区使用的班杜拉语——提供了这一缺口,介绍了来自匿名社交媒体对话中精选的新型乌萨斯语-英语口语数据集。数据集标注了意图、情感、对话行为、代码混合和语气,并已公开发布于https://github.com/HappymoreMasoka/Working_with_shona-slang。我们对基于多语言DistilBERT的意图识别分类器进行了微调,实现了96.4%的准确率和96.3%的F1分数,模型已部署于https://huggingface.co/HappymoreMasoka。该分类器集成到混合聊天机器人中,后者结合规则基响应与检索增强生成(RAG)以处理特定领域查询,演示通过协助佩斯大学学生获取研究生项目信息的用例。定性评估表明,混合系统在文化相关性和用户参与度方面优于仅采用RAG的基线。通过发布数据集、模型和方法,本工作推动了非洲语言的NLP资源,促进了包容性且符合文化语境的对话式AI发展。

关键词

引用

@article{arxiv.2509.14249,
  title  = {Advancing Conversational AI with Shona Slang: A Dataset and Hybrid Model for Digital Inclusion},
  author = {Happymore Masoka},
  journal= {arXiv preprint arXiv:2509.14249},
  year   = {2025}
}