中文

SG-UniBuc-NLP 在 SemEval-2026 Task 6 中的参赛方案:基于分块的多头 RoBERTa 用于长文本规避检测

计算与语言 2026-04-30 v1 人工智能 机器学习

摘要

我们描述了用于 SemEval-2026 Task 6(CLARITY:Unmasking Political Question Evasions)的系统,该系统对英文政治采访回答按粗粒度清晰度(3 分类)和细粒度规避策略(9 分类)进行分类。由于回答常常超过标准 Transformer 编码器的 512 token 限制,我们采用带元素级最大池聚合的重叠滑动窗口分块策略。共享的 RoBERTa-large 编码器提供两个任务特定的头部,通过多任务目标进行联合训练,推理时采用 7 折分层交叉验证的集成。我们的系统在 Subtask 1 上获得 Macro-F1 为 0.80,在 Subtask 2 上获得 0.51,分别在两项任务中排名第 11。

关键词

引用

@article{arxiv.2604.26375,
  title  = {SG-UniBuc-NLP at SemEval-2026 Task 6: Multi-Head RoBERTa with Chunking for Long-Context Evasion Detection},
  author = {Gabriel Stefan and Sergiu Nisioi},
  journal= {arXiv preprint arXiv:2604.26375},
  year   = {2026}
}

备注

Accepted to SemEval-2026 (Task 6: CLARITY: Unmasking Political Question Evasions)