OpenAI Says Two API Settings Tripled GPT-5.6's ARC-AGI-3 Score
OpenAI says retaining reasoning and enabling compaction tripled GPT-5.6 Sol's 7.8% ARC-AGI-3 score and cut output tokens 6x, arguing generic harnesses distort frontier model evals.
Topic
Topic
OpenAI says retaining reasoning and enabling compaction tripled GPT-5.6 Sol's 7.8% ARC-AGI-3 score and cut output tokens 6x, arguing generic harnesses distort frontier model evals.