Computation and Language · Computer Science
BotEval: Facilitating Interactive Human Evaluation
Hyundong Cho, Thamme Gowda, Yuyang Huang, Zixun Lu +2
2024-07-26
Software Engineering · Computer Science
A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management
Yang Liu, Li Zhang, Fang Liu, Ping Lin +1
2026-03-09
Computation and Language · Computer Science
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
Yi-Kai Zhang, Xu-Xiang Zhong, Shiyin Lu, Qing-Guo Chen +2
2024-12-10
Computation and Language · Computer Science
FlowEval: A Consensus-Based Dialogue Evaluation Framework Using Segment Act Flows
Jianqiao Zhao, Yanyang Li, Wanyu Du, Yangfeng Ji +3
2022-11-04
Computation and Language · Computer Science
ConvLab-2: An Open-Source Toolkit for Building, Evaluating, and Diagnosing Dialogue Systems
Qi Zhu, Zheng Zhang, Yan Fang, Xiang Li +6
2020-04-30
Computation and Language · Computer Science
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He +7
2026-03-11
Computation and Language · Computer Science
Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
Samridhi Raj Sinha, Rajvee Sheth, Abhishek Upperwal, Mayank Singh
2026-03-06
Computation and Language · Computer Science
ConvoKit: A Toolkit for the Analysis of Conversations
Jonathan P. Chang, Caleb Chiam, Liye Fu, Andrew Z. Wang +2
2020-05-12
Computation and Language · Computer Science
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
Zhuohao Yu, Chang Gao, Wenjin Yao, Yidong Wang +5
2024-04-10
Computation and Language · Computer Science
MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
José Pombal, Maya D'Eon, Nuno M. Guerreiro, Pedro Henrique Martins +2
2025-12-08
Artificial Intelligence · Computer Science
LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks
Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen +7
2026-03-03
Computation and Language · Computer Science
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
Yang Liu, Meng Xu, Shuo Wang, Liner Yang +7
2026-02-02
Robotics · Computer Science
AutoEval: Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World
Zhiyuan Zhou, Pranav Atreya, You Liang Tan, Karl Pertsch +1
2025-04-04
Computation and Language · Computer Science
Evaluating Large Language Models with fmeval
Pola Schwöbel, Luca Franceschi, Muhammad Bilal Zafar, Keerthan Vasist +6
2024-07-19
Computation and Language · Computer Science
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
Prannaya Gupta, Le Qi Yau, Hao Han Low, I-Shiang Lee +7
2024-08-21
Computation and Language · Computer Science
SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation
Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert +8
2026-05-12
Computation and Language · Computer Science
ParlAI: A Dialog Research Software Platform
Alexander H. Miller, Will Feng, Adam Fisch, Jiasen Lu +4
2018-03-12
Artificial Intelligence · Computer Science
SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation
Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert +7
2025-12-15
Computation and Language · Computer Science
SimulEval: An Evaluation Toolkit for Simultaneous Translation
Xutai Ma, Mohammad Javad Dousti, Changhan Wang, Jiatao Gu +1
2020-08-03
Computation and Language · Computer Science
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
Chaoqun He, Renjie Luo, Shengding Hu, Yuanqian Zhao +6
2024-07-23
Computation and Language · Computer Science
LatEval: An Interactive LLMs Evaluation Benchmark with Incomplete Information from Lateral Thinking Puzzles
Shulin Huang, Shirong Ma, Yinghui Li, Mengzuo Huang +3
2024-03-19