Interaktiivisen ongelmanratkaisun Standard-tulokset. GPT-6 Astra 62,71 %; Provider Adapter -ennätys 99,95 % käsitellään erikseen.
Tulostaulukko
| Sija | Malli | Tulos | Lähde |
|---|---|---|---|
| #1 | 62,71 % | ||
| #2 | 30,16 % | ||
| #3 | 7,78 % | ||
| #4 | 2,1 % | ||
| #5 | 0,8 % | ||
| #6 | 0,42 % | ||
| #7 | 0,18 % | ||
| #8 | 0,1 % |
Tietoa benchmarkista
- Lähde
- ARC Prize
- Päivitetty
- 7.9.2026
- Linkki
- Avaa lähde
ARC-AGI-3 mittaa, kuinka hyvin tekoälyagentti oppii uuden interaktiivisen ympäristön säännöt kokeilemalla. Agentin pitää tutkia ympäristöä, hyödyntää palautetta ja ratkaista tehtäviä tehokkaasti. Se täydentää ARC-AGI-2:n staattisia päättelytehtäviä.
Tilanne 7.9.2026: Astra nosti tulostason
GPT-6 Astra saavuttaa ARC Prizen Standard-ajossa 62,71 % (max). Claude Opus 5:n tulos on 30,16 % (high) ja GPT-5.6 Solin 7,78 % (max). Sivun varsinainen tuloslista näyttää Standard-ajot: kustakin mallista on valittu sen paras julkaistu tulos, joten päättelyasetukset ja laskentabudjetit vaihtelevat.
Astran Provider Adapter -tulos: 99,95 %
OpenAI:n Provider Adapter säilyttää mallin päättelytilaa ja tiivistää pitkää keskustelua. Standard-ajossa seuraaviin vaiheisiin kulkevat mallin itse valitsemat muistiinpanot. Kyse on kahdesta erilaisesta arviointitavasta, joten adapterin tuloksia ei sekoiteta Standard-sijoituksiin.
| Astran päättelyasetus | Standard | Provider Adapter |
|---|---|---|
| Max | 62,71 % | 98,55 % |
| XHigh | 59,34 % | 98,44 % |
| High | 54,82 % | 99,95 % |
| Medium | 38,59 % | 98,44 % |
| Low | 17,45 % | 98,03 % |
| None | 35,18 % | 96,72 % |
Paras Standard-ajo maksoi ARC Prizen arvion mukaan 26 098 USD ja paras adapteriajo 18 817 USD. ARC-AGI-3:n prosentti kuvaa tehtävissä etenemisen tehokkuutta suhteessa ihmisvertailuun. Lähes 100 prosentin tulos ei yksin osoita yleisen tekoälyn saavuttamista.
Claude Fable 5.1:lle ja uusille Gemini Flash -malleille ei tarkistushetkellä ollut ARC Prizen julkaisemaa ARC-AGI-3-tulosta. Puuttuva tulos ei tarkoita nollaa. Luna-rivin ARC-AGI-3-tulos koskee 9.7.2026 arvioitua versiota. Vanhojen GPT-5.4-, Opus 4.6- ja Grok 4.20 -rivien luvut on päivitetty leaderboardin yhden desimaalin tarkkuudella.
Lähteet: Astran arviointiraportti, Opus 5:n raportti, GPT-5.6:n raportti ja ARC Prizen ajantasainen leaderboard. Tarkistettu käsin 7.9.2026.
