Back to papers
arxiv8.0 / 10

The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning

Nathaniel Li, Alexander Pan, Anjali Gopal, Summer Yue, Daniel Berrios, Alice Gatti, Justin Li, Ann-Kathrin Dombrowski, Shashwat Goel, Long Phan, Gabriel Mukobi, Nathan Helm-Burger, Rassin R. Lababidi, Lennart Justen, Andrew Liu, Michael Chen, Isabelle Barrass, Oliver Zhang, Xiaoyuan Zhu, Rishub Tamirisa, Bhrugu Bharathi, Adam Khoja, Ariel Herbert-Voss, Cort B. Breuer, Andy Zou, Mantas Mazeika, Zifan Wang, Palash Oswal, Weiran Liu, A-M Hunt, Justin Tienken-Harder, Kevin Y. Shih, Kemper Talley, J. Guan, Russell Kaplan, Ian Steneker, David Campbell, Brad Jokubaitis, A. Levinson, Jean Wang, William Qian, K. Karmakar, Steven Basart, Stephen Fitz, M. Levine, P. Kumaraguru, U. Tupakula, Vijay Varadharajan, Yan Shoshitaishvili, Jimmy Ba, K. Esvelt, Alexandr Wang, Dan Hendrycks

Abstract

Unlearning benchmark for measuring and reducing malicious use of AI

Published
2024
Source
arxiv
Org
Center for AI Safety
View paper
Sign in to read and join the discussion.