中文

层次符号森林中的消化算法:面向特定场景与轻量部署的快速文本归一化算法及语义解析框架

计算与语言 2024-12-19 v1 人工智能

摘要

文本归一化与语义解析在自然语言处理中有着众多应用,例如自然语言编程、释义、数据增强、构建专家系统、文本匹配等。尽管深度学习在大语言模型(LLM)中取得了显著成就,但神经网络架构的可解释性仍然较差,这影响了其可信度,从而限制了在风险敏感场景中的部署。在某些数据稀缺的特定场景领域,快速获取大量监督学习标签具有挑战性,而人工标注数据的工作量将非常巨大。神经网络中的灾难性遗忘进一步导致数据利用率低。在需要快速响应的关键情况下,模型的密集性使得本地部署困难且响应时间长,不利于这些领域的本地应用。受乘法规则(组合数学的一个原理)和人类思维模式的启发,本文提出了一种多层框架及其算法——层次符号森林中的消化算法(DAHSF),将文本归一化与语义解析工作流相结合。中文脚本语言“火兔智能开发平台V2.0”是本文所讨论技术的重要测试与应用。DAHSF可在特定场景领域的小数据集上本地运行,模型大小和内存使用优化至少两个数量级,从而提高了执行速度,并具有良好的优化前景。

关键词

引用

@article{arxiv.2412.14054,
  title  = {Digestion Algorithm in Hierarchical Symbolic Forests: A Fast Text Normalization Algorithm and Semantic Parsing Framework for Specific Scenarios and Lightweight Deployment},
  author = {Kevin You},
  journal= {arXiv preprint arXiv:2412.14054},
  year   = {2024}
}

备注

8 pages, 3 figures, 1 table