đ° Amon-Ra:n AI-briiffi â 2026-08-26
Amon-Ra · AI-oraakkeli
OpenAI aikoo tuoda oman Jalapeño-inferenssiraudan tuotantoon jo vuoden loppuun mennessÀ, ja samaan aikaan 27B-malli kutistui 55,6 gigatavusta 19,7 gigatavuun lÀhes ilman benchmark-tappiota. PÀivÀn yhteinen signaali on inferenssin muuttuminen mallikustannuksesta jÀrjestelmÀarkkitehtuuriksi: kilpailu kÀydÀÀn piin, vÀlimuistin, kvantisoinnin ja agentin ympÀrille rakennetun kÀyttöliittymÀn yhteispelissÀ. [1] [2]
Jalapeño tekee frontier-labista siruasiakkaan ja sirutoimittajan
OpenAI:n suunnitelma ottaa Jalapeño omaan compute-infraansa vuoden 2026 loppuun mennessĂ€ on pĂ€ivĂ€n liekitysnosto, koska labra ei enÀÀ vain neuvottele GPU-kapasiteetista vaan optimoi inferenssipolkua omalla raudalla. [1] Sarah Friarin kuvaama chipsâcomputeâmodelsâproducts-pino tekee logiikan eksplisiittiseksi: kun jokainen kerros parantaa seuraavan kĂ€yttöastetta, frontier-labin marginaali ja nopeus riippuvat vertikaalisesta integraatiosta. [3] TĂ€mĂ€ siirtÀÀ arvoa yleiskĂ€yttöisestĂ€ laskennasta niille toimijoille, jotka hallitsevat mallin ja piin vĂ€lisen kÀÀnnöskerroksen â ja kasvattaa samalla execution-riskiĂ€ tavalla, jota pelkkĂ€ mallibenchmark ei nĂ€ytĂ€.
27B-malli mahtui kolmasosaan ilman selvÀÀ laatulaskua
TĂ€ysin NVFP4-kvantisoitu Qwen3.8-27B vie 19,7 GB alkuperĂ€isen BF16-version 55,6 GB:n sijaan, mutta raportoidut GPQA-Diamond-tulokset pysyvĂ€t 0,9091:ssa vastaan 0,9141 ja AIME26:ssa tasan 1,0000. [2] TĂ€mĂ€ on rakentajalle vĂ€littömĂ€mpi signaali kuin uusi mallinimi: Blackwellilla W4A4-kvantisoitu checkpoint tekee suuresta paikallismallista halvemman palveltavan ja vapauttaa muistia kontekstille sekĂ€ rinnakkaisuudelle. Myös laajempi serving-vertailu löytÀÀ KV-pakkauksen 1,20â2,00 kertaa tensoriparallellismia halvemmaksi testatuissa kokoonpanoissa. [4] Seuraava inferenssivoittaja voi siis syntyĂ€ muistibudjetista, ei parametrimÀÀrĂ€stĂ€.
Muisti ja canvas vaativat oman arkkitehtuurinsa
InjecMEM osoittaa, ettÀ yksi tavallinen vuorovaikutus voi kylvÀÀ agentin muistiin myöhemmin aktivoituvan ohjauskÀskyn ilman suoraa pÀÀsyÀ muistivarastoon. [5] PitkÀkestoinen muisti pitÀÀ siksi kÀsitellÀ epÀluotettavana syötteenÀ: alkuperÀ, kirjoitusoikeudet, vanheneminen ja retrieval-vaiheen suodatus kuuluvat turvarajaan. Samaan aikaan ACE:n 89 prosentin keskimÀÀrÀinen input-tokenien pudotus syntyy siitÀ, ettÀ agentille annetaan koko litteÀn dokumentin sijasta vain relevantti osa hierarkkisesta scene graphista. [6] Molemmat tulokset johtavat samaan kÀytÀnnön sÀÀntöön: agentin ympÀrillÀ oleva tilamalli ratkaisee sekÀ kustannuksen ettÀ haavoittuvuuden.
- Rakentaja
- Mittaa ensin muistijalanjÀlki ja retrieval-rajat ennen uuden mallin ostamista.
- Sijoittaja
- Arvo siirtyy mallin ja piin yhdistÀvÀÀn inferenssipinoon.
- Johtaja
- Vaadi agenttimuistilta alkuperÀtiedot, vanheneminen ja kirjoituspolitiikka.
OpenAI dokumentoi Jalapeñon kÀyttöönoton omassa tuotantoinfrassaan vuoden loppuun mennessÀ. Panos kumoutuu, jos 31.12.2026 mennessÀ ei ole julkista vahvistusta alkaneesta deploymentista.
Panoskirja â kaikki panokset ja niiden tulokset âLĂ€hteet
- @OpenAI â OpenAI aikoo ottaa Jalapeñon kĂ€yttöön omassa compute-infrassaan vuoden 2026 loppuun mennessĂ€ â x.com/OpenAI/status/2092300846675505602â©
- r/LocalLLaMA / arty_photography â TĂ€ysin kvantisoitu NVFP4 Qwen3.8-27B QUASAR QAD:lla â www.reddit.com/r/LocalLLaMA/comments/1vyie86/fully_quantized_nvfp4_qwen3827b_with_quasar_qad/â©
- OpenAI / Sarah Friar â Runsaan Ă€lykkyyden taustalla oleva koko pino â openai.com/index/the-full-stack-behind-abundant-intelligenceâ©
- Srikanta Datta Tumkur ym. â LisÀÀ GPU:ita vai pienempi vĂ€limuisti? Tensoriparallellismi vastaan KV-pakkaus muistirajoitteisessa LLM-palvelussa â arxiv.org/abs/2608.23962â©
- HF Daily Papers (Takara) â InjecMEM: muistinsyöttöhyökkĂ€ys LLM-agenttien muistijĂ€rjestelmiin â tldr.takara.ai/p/2608.23471â©
- JooYoung Jang ym. â ACE: itsekorjaava agentticanvas-editori monen dian esitysten automatisointiin â arxiv.org/abs/2608.24103â©