Computation and Language · Computer Science
Rethinking Interpretability in the Era of Large Language Models
Chandan Singh, Jeevana Priya Inala, Michel Galley, Rich Caruana +1
2024-02-06
Computation and Language · Computer Science
Recent advancements in LLM Red-Teaming: Techniques, Defenses, and Ethical Considerations
Tarun Raheja, Nilay Pochhi, F. D. C. M. Curie
2024-12-18
Artificial Intelligence · Computer Science
Because we have LLMs, we Can and Should Pursue Agentic Interpretability
Been Kim, John Hewitt, Neel Nanda, Noah Fiedel +1
2025-06-17
Computation and Language · Computer Science
Red Teaming Language Model Detectors with Language Models
Zhouxing Shi, Yihan Wang, Fan Yin, Xiangning Chen +2
2023-10-20
Computation and Language · Computer Science
Case Study: Testing Model Capabilities in Some Reasoning Tasks
Min Zhang, Sato Takumi, Jack Zhang, Jun Wang
2024-02-16
Computation and Language · Computer Science
Exploring Straightforward Conversational Red-Teaming
George Kour, Naama Zwerdling, Marcel Zalmanovici, Ateret Anaby-Tavor +2
2024-09-10
Computation and Language · Computer Science
Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis
Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider
2026-05-15
Computation and Language · Computer Science
Rethinking Large Language Models in Mental Health Applications
Shaoxiong Ji, Tianlin Zhang, Kailai Yang, Sophia Ananiadou +1
2023-12-19
Computation and Language · Computer Science
How Far Will They Go? Red-Teaming Online Influence with Large Language Models
Daniel C. Ruiz, Anna Serbina, Ashwin Rao, Emilio Ferrara +1
2026-05-25
Computation and Language · Computer Science
Red Teaming Large Language Models for Healthcare
Vahid Balazadeh, Michael Cooper, David Pellow, Atousa Assadi +31
2025-07-14
Computation and Language · Computer Science
Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models
Alberto Purpura, Sahil Wadhwa, Jesse Zymet, Akshay Gupta +4
2025-03-06
Computation and Language · Computer Science
Towards Red Teaming in Multimodal and Multilingual Translation
Christophe Ropers, David Dale, Prangthip Hansanti, Gabriel Mejia Gonzalez +8
2024-01-30
Computation and Language · Computer Science
Evaluating statistical language models as pragmatic reasoners
Benjamin Lipkin, Lionel Wong, Gabriel Grand, Joshua B Tenenbaum
2023-05-03
Human-Computer Interaction · Computer Science
LLMs in Qualitative Research: Opportunities, Limitations, and Practical Considerations
Henry Salgado, Meagan R. Kendall, Martine Ceberio, Alexandra Coso Strong
2026-05-19
Computation and Language · Computer Science
Competition of Mechanisms: Tracing How Language Models Handle Facts and Counterfactuals
Francesco Ortu, Zhijing Jin, Diego Doimo, Mrinmaya Sachan +2
2024-06-10
Computers and Society · Computer Science
Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation
Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola
2026-02-24
Computation and Language · Computer Science
LLMs as Research Tools: A Large Scale Survey of Researchers' Usage and Perceptions
Zhehui Liao, Maria Antoniak, Inyoung Cheong, Evie Yu-Yen Cheng +4
2024-11-11
Artificial Intelligence · Computer Science
BELL: Benchmarking the Explainability of Large Language Models
Syed Quiser Ahmed, Bharathi Vokkaliga Ganesh, Jagadish Babu P, Karthick Selvaraj +2
2025-04-29