OpenAI Trains GPT-5 Mini-R to Obey the Instruction Hierarchy
OpenAI's IH-Challenge RL dataset taught GPT-5 Mini-R to prioritize system over developer over user over tool, cutting prompt-injection and jailbreak success while preserving general capability.