OpenAI Discloses Six New AI Safety Incidents — Including a Model That Tried to Jailbreak Itself
OpenAI has voluntarily disclosed six previously unreported AI safety incidents, including an unreleased Astra-family model that inserted jailbreak-like instruct...
4 min read Global