ARC-AGI-3

By

maalis 25, 2026
Benchmark

Interaktiivisen ongelmanratkaisun Standard-tulokset. GPT-6 Astra 62,71 %; Provider Adapter -ennätys 99,95 % käsitellään erikseen.

Kärkitulos 62,71 %
Mediaani 1,45 %
Tuloshaitari 0,1 % - 62,71 %

Tulostaulukko

Näytä myös vanhat mallit (6)

Oletuksena mukana ovat vain ajantasaiset julkiset mallit. Avaa halutessasi myös vanhemmat ja poistuvat rivit.

SijaMalliTulosLähde
#1
GPT-6 Astra OpenAI
62,71 % ARC Prize · Standard · max · Päivitetty 7.9.2026
#2
Claude Opus 5 Anthropic
30,16 % ARC Prize · Standard · high · Päivitetty 7.9.2026
#3
GPT-5.6 Sol OpenAI
7,78 % ARC Prize · Standard · max · Päivitetty 7.9.2026
#42,1 % ARC Prize · Standard · xhigh · lähteessä 1 desimaali · Päivitetty 7.9.2026
#50,8 % ARC Prize · Standard · max · Päivitetty 7.9.2026
#6
Gemini 3.1 Pro Google DeepMind
0,42 % OpenAI · ARC-AGI-3-vertailu · preview · Päivitetty 7.9.2026
#7
GPT-5.6 Luna OpenAI
0,18 % ARC Prize · Standard · max; 9.7.2026 snapshot · Päivitetty 7.9.2026
#80,1 % ARC Prize · Standard · beta reasoning · lähteessä 1 desimaali · Päivitetty 7.9.2026

Tietoa benchmarkista

Lähde
ARC Prize
Päivitetty
7.9.2026

ARC-AGI-3 mittaa, kuinka hyvin tekoälyagentti oppii uuden interaktiivisen ympäristön säännöt kokeilemalla. Agentin pitää tutkia ympäristöä, hyödyntää palautetta ja ratkaista tehtäviä tehokkaasti. Se täydentää ARC-AGI-2:n staattisia päättelytehtäviä.

Tilanne 7.9.2026: Astra nosti tulostason

GPT-6 Astra saavuttaa ARC Prizen Standard-ajossa 62,71 % (max). Claude Opus 5:n tulos on 30,16 % (high) ja GPT-5.6 Solin 7,78 % (max). Sivun varsinainen tuloslista näyttää Standard-ajot: kustakin mallista on valittu sen paras julkaistu tulos, joten päättelyasetukset ja laskentabudjetit vaihtelevat.

Astran Provider Adapter -tulos: 99,95 %

OpenAI:n Provider Adapter säilyttää mallin päättelytilaa ja tiivistää pitkää keskustelua. Standard-ajossa seuraaviin vaiheisiin kulkevat mallin itse valitsemat muistiinpanot. Kyse on kahdesta erilaisesta arviointitavasta, joten adapterin tuloksia ei sekoiteta Standard-sijoituksiin.

Astran päättelyasetusStandardProvider Adapter
Max62,71 %98,55 %
XHigh59,34 %98,44 %
High54,82 %99,95 %
Medium38,59 %98,44 %
Low17,45 %98,03 %
None35,18 %96,72 %

Paras Standard-ajo maksoi ARC Prizen arvion mukaan 26 098 USD ja paras adapteriajo 18 817 USD. ARC-AGI-3:n prosentti kuvaa tehtävissä etenemisen tehokkuutta suhteessa ihmisvertailuun. Lähes 100 prosentin tulos ei yksin osoita yleisen tekoälyn saavuttamista.

Claude Fable 5.1:lle ja uusille Gemini Flash -malleille ei tarkistushetkellä ollut ARC Prizen julkaisemaa ARC-AGI-3-tulosta. Puuttuva tulos ei tarkoita nollaa. Luna-rivin ARC-AGI-3-tulos koskee 9.7.2026 arvioitua versiota. Vanhojen GPT-5.4-, Opus 4.6- ja Grok 4.20 -rivien luvut on päivitetty leaderboardin yhden desimaalin tarkkuudella.

Lähteet: Astran arviointiraportti, Opus 5:n raportti, GPT-5.6:n raportti ja ARC Prizen ajantasainen leaderboard. Tarkistettu käsin 7.9.2026.

By