Back to papers
semanticscholar8.0 / 10

Towards Safety Cases For AI Scheming

Mikita Balesni, Marius Hobbhahn, David Lindner, Alexander Meinke, Tomasz Korbak, Joshua Clymer, Buck Shlegeris, Jérémy Scheurer, R. Shah, Nicholas Goldowsky-Dill, Dan Braun, Bilal Chughtai, Owain Evans, Daniel Kokotajlo, Lucius Bushnaq

Abstract

Evaluation framework development for creating safety cases related to AI scheming behaviors

Research area

agent foundationspost-trainingrobustness to domain shifts
Published
2024
Source
semanticscholar
Org
Apollo Research
View paper
Sign in to read and join the discussion.