OpenAI shares a framework for tracking, investigating, and disclosing model misalignment, alongside six reports of unexpected or concerning model behavior.
Firehose
Filtered to Companies, tagged “model safety” · clear filters
Browse: People · Companies · Papers · Podcasts · Hacker News · Deep dives