Marktmannen wiki AI-platforms

ARC-AGI-3 en GPT-5.6

Laatst bijgewerkt: 26-07-2026

TL;DR: GPT-5.6 (Sol) scoort ~90% op ARC-AGI-1 en -2 maar slechts 7,8% op ARC-AGI-3 — het eerste model dat er überhaupt één level van oplost; het gat onthult dat "fluïde intelligentie" (ter plekke oriënteren in een onbekende omgeving) nog niet is opgelost, ook al is agentic/coding-vaardigheid vrijwel af.

Vertaling/analyse (oorspronkelijk Alberto Romero, The Algorithmic Bridge) van OpenAI's GPT-5.6-lancering, bekeken door de lens van de ARC-AGI-benchmarkreeks van François Chollet.

De kern: twee soorten intelligentie

  • Gekristalliseerde intelligentie: patronen en taken die het model al kent uit trainingsdata — hier zijn frontier-modellen inmiddels overweldigend goed in (wiskundebewijzen, agentic coding).
  • Fluïde intelligentie: ter plekke, efficiënt problemen oplossen waar je nog nooit mee te maken hebt gehad, zonder bekende regels of skillset. Mensen doen dit moeiteloos (bijv. een onverwacht object op de weg herkennen en erop reageren zonder het te kunnen benoemen); AI worstelt zodra een probleem "buiten de verdeling" valt.

ARC-AGI-3 is zo ontworpen dat het voor mensen intuïtief aanvoelt (mensen scoren >90%) maar draait om precies dat soort fluïde oriëntatie in een onbekende spelomgeving.

Wat GPT-5.6 (Sol) laat zien

  • ~90% op ARC-AGI-1 en -2, tegen verwaarloosbare kosten per taak — een nieuw Pareto-front voor prestatie-efficiëntie.
  • Slechts 7,8% op ARC-AGI-3 — laag in absolute zin, maar een kwalitatieve mijlpaal: Sol is het eerste geverifieerde frontier-model dat een level heeft opgelost.
  • Waarom Sol wint waar andere modellen falen: het oriënteert zich sneller en beter in een nieuwe omgeving — het doorgrondt vrijwel altijd de kernmechanismen van een level. Faalt het, dan gebeurt dat in de planning-/uitvoeringsfase, nooit in de waarnemingsfase.
  • Waar het misgaat: naarmate de benodigde redeneerketen dieper wordt, kan het model wat het net heeft geleerd niet meer samenvoegen tot een werkend plan — een geheugen-/planningsprobleem, geen waarnemingsprobleem. De volledige evaluatie bij maximale redeneerinspanning kostte bijna $20.000.

Waarom dit relevant is voor de AGI-discussie

AI-bedrijven zijn de definitie van AGI economisch gaan invullen ("80% van kantoorwerk automatiseren", omzetdrempels) omdat daar het commerciële geld zit. Het artikel houdt een strengere lat aan: er is geen AGI zolang ARC-AGI in al zijn versies niet is "uitgespeeld". Zodra ARC-AGI-3 op zijn beurt verslagen wordt (het ARC Prize-team werkt al aan ARC-AGI-4), verschuift de lat opnieuw — met de open vraag hoeveel iteraties dit patroon nog kan doormaken.

Praktische implicatie

Voor agentic/coding-taken (waar Marktmannen mee werkt) is het gat vrijwel gedicht — dat verklaart waarom Claude Code, Codex en vergelijkbare harnassen zo snel bruikbaarder worden. Voor taken die om echte oriëntatie in een nieuwe, ongestructureerde situatie vragen (geen bekende tools, geen bekend patroon) blijft voorzichtigheid geboden: het model oriënteert zich prima, maar valt terug op geheugen-/planningsfouten zodra de keten lang wordt.

Open vragen

  • Hoe presteert Anthropics Fable op ARC-AGI-3? Het artikel merkt op dat dit nog niet getest is.
  • Vertaalt de "fluïde vs. gekristalliseerde intelligentie"-scheiding zich naar iets meetbaars in agentic-coding-taken, of blijft het een aparte as?

Verwante concepten

Bronnen