semanticscholar8.0 / 10
Towards Safety Cases For AI Scheming
Mikita Balesni, Marius Hobbhahn, David Lindner, Alexander Meinke, Tomasz Korbak, Joshua Clymer, Buck Shlegeris, Jérémy Scheurer, R. Shah, Nicholas Goldowsky-Dill, Dan Braun, Bilal Chughtai, Owain Evans, Daniel Kokotajlo, Lucius Bushnaq
Abstract
Evaluation framework development for creating safety cases related to AI scheming behaviors
Research area
agent foundationspost-trainingrobustness to domain shifts
Published
2024
Source
semanticscholar
Org
Apollo Research
Sign in to read and join the discussion.