Back to papers
semanticscholar8.0 / 10

Model Evaluation for Extreme Risks

Toby Shevlane, Sebastian Farquhar, Ben Garfinkel, Mary Phuong, Jess Whittlestone, Jade Leung, Daniel Kokotajlo, Nahema Marchal, Markus Anderljung, Noam Kolt, Lewis Ho, Divya Siddarth, S. Avin, W. Hawkins, Been Kim, Iason Gabriel, Vijay Bolina, Jack Clark, Y. Bengio, P. Christiano, Allan Dafoe

Abstract

Approaches for evaluating AI systems for extreme risks and dangerous capabilities

Research area

agentic misalignmentai alignmentmisalignment
Published
2023
Source
semanticscholar
Org
GovAI Oxford
View paper
Sign in to read and join the discussion.