中文

使用软 RLLF 平衡 LLM 的探索与利用以增强否定理解

计算与语言 2024-03-05 v1 人工智能

摘要

NLP 中的微调方法通常侧重于利用而非探索,这可能导致次优模型。鉴于自然语言的庞大搜索空间,这种有限的探索会限制其在复杂、高风险领域中的性能,而在这些领域中,准确的否定理解与逻辑推理能力至关重要。为解决这一问题,我们利用逻辑反馈强化学习(RLLF)在 LLM 中创造探索与利用的有效平衡。我们的方法采用合适的基准数据集进行训练与评估,突出了探索在增强否定理解能力方面的重要性。我们将 RLLF 增强的 LLM 与未使用 RLLF 训练的基线模型进行性能比较,展示了这种平衡方法的价值。此外,我们通过采用迁移学习并评估其对否定理解的影响,展示了我们的方法在法律 AI 应用中的潜力。我们的实验结果表明,利用 RLLF 平衡探索与利用在提升 LLM 否定能力方面的有效性。这对于在高风险领域开发更准确、可靠且逻辑一致的语言模型具有重要意义。

关键词

引用

@article{arxiv.2403.01185,
  title  = {Balancing Exploration and Exploitation in LLM using Soft RLLF for Enhanced Negation Understanding},
  author = {Ha-Thanh Nguyen and Ken Satoh},
  journal= {arXiv preprint arXiv:2403.01185},
  year   = {2024}
}

备注

JURISIN 2024