OpenAI Releases Open-Weight Moderation Models That Reason From Policy
OpenAI's gpt-oss-safeguard-120b and 20b are open-weight models post-trained from gpt-oss to label content by reasoning from a supplied policy, with baseline safety evaluations published.