semanticscholar8.0 / 10
Model Evaluation for Extreme Risks
Toby Shevlane, Sebastian Farquhar, Ben Garfinkel, Mary Phuong, Jess Whittlestone, Jade Leung, Daniel Kokotajlo, Nahema Marchal, Markus Anderljung, Noam Kolt, Lewis Ho, Divya Siddarth, S. Avin, W. Hawkins, Been Kim, Iason Gabriel, Vijay Bolina, Jack Clark, Y. Bengio, P. Christiano, Allan Dafoe
Abstract
Approaches for evaluating AI systems for extreme risks and dangerous capabilities
Research area
agentic misalignmentai alignmentmisalignment
Published
2023
Source
semanticscholar
Org
GovAI Oxford
Sign in to read and join the discussion.