myynti@metsosivut.fi

041 498 9805

Soita

"*" näyttää pakolliset kentät

Kenttä on validointitarkoituksiin ja tulee jättää koskemattomaksi.
041 498 9805
Aloitetaan keskustelu ➤
astra

GPT-6 Astra selkokielellä: mikä muuttuu, kun tekoäly tekee koko työn?

Uuden tekoälymallin julkaisusta kerrotaan usein, että se on edeltäjäänsä nopeampi tai saa parempia pisteitä testeissä. GPT-6 Astran kohdalla kiinnostavampi kysymys on käytännöllinen: pystyykö tekoäly hoitamaan kokonaisen tehtävän sen sijaan, että se vain neuvoisi, miten tehtävä tehdään?

Astra ja GPT-5.6 Sol: mikä ero niillä on?

OpenAI vertasi Astran julkaisussa mallia aiempaan GPT-5.6 Soliin. Molemmat osaavat ratkaista vaikeita ongelmia ja käyttää työkaluja. Erot näkyvät erityisesti monivaiheisessa työssä, tietokoneen käytössä ja pitkän aineiston käsittelyssä.

VertailukohtaGPT-5.6 SolGPT-6 Astra
Vaativat kysymyksetRatkaisee vaikeita yksittäisiä ongelmia.Yltää monissa OpenAI:n testeissä parempiin tuloksiin.
Monivaiheinen työVoi tehdä useita työvaiheita ja käyttää työkaluja.On suunniteltu viemään pidempiä työnkulkuja loppuun.
PäättelyketjuKäyttää vaikeissa tehtävissä usein tekstimuotoisia välivaiheita.Selviytyy aiempaa useammista tehtävistä myös ilman niitä.
Muuttuva tehtäväVoi tarvita muistutusta alkuperäisestä tavoitteesta.Pysyy OpenAI:n mukaan paremmin tavoitteessa lisäpyyntöjen jälkeen.
Pitkä aineistoVoi käsitellä suuren määrän tietoa.Löytää OpenAI:n testissä olennaisen tiedon useammin.
Tehtävän rajatKäyttää annettuja oikeuksia ja ohjeita.Noudattaa OpenAI:n arvioissa paremmin valtuutuksen rajoja.

Taulukko kuvaa suuntaa, ei lupausta siitä, että Astra olisi jokaisessa tehtävässä parempi. Eikä Sol ole vain kysymyksiin vastaava chatbot: sekin voi tehdä kokonaisia töitä. Astran etu näkyy OpenAI:n julkaisemissa vertailuissa ja kuvauksessa siitä, mihin mallia on kehitetty. (OpenAI:n julkaisu)

Kilpailijavertailu näyttää, mitä ”koko tehtävä” tarkoittaa

Palataan pyyntöön: ”Tutki viisi kilpailijaa, vertaile hintoja ja tuotteita, tee Excel-taulukko ja kirjoita raportti.”

Työ voisi edetä näin:

  1. Etsi tiedot. Malli käy läpi kilpailijoiden sivut ja merkitsee lähteet.
  2. Kokoa vertailu. Se vie hinnat ja ominaisuudet taulukkoon.
  3. Huomaa aukot. Jos yhden tuotteen hinta puuttuu tai hinnat koskevat eri paketteja, se selvittää asian tai merkitsee epävarmuuden.
  4. Kirjoita raportti. Se kertoo tärkeimmät erot ja viittaa taulukon tietoihin.
  5. Tarkista lopputulos. Se korjaa ristiriidat, jotka löytyvät raportin, taulukon ja lähteiden väliltä.

Tällaista toimintaa kutsutaan usein tekoälyagentin työksi. Sana tarkoittaa tässä järjestelmää, joka voi suunnitella välivaiheita ja käyttää sille annettuja työkaluja tavoitteen saavuttamiseksi. Malli ei kuitenkaan pääse tiedostoihisi, selaimeesi tai ohjelmiisi pelkän nimensä perusteella. Sillä täytyy olla tehtävään sopiva käyttöympäristö ja oikeudet.

Miltä parannus näyttää testeissä?

OpenAI on julkaissut Astrasta muun muassa seuraavat tulokset. Pistemäärät koskevat nimettyjä testejä ja niiden asetuksia, joten niitä ei pidä lukea onnistumistodennäköisyydeksi omassa työssä.

TestiMitä se mittaa lyhyesti?GPT-5.6 SolGPT-6 Astra
OSWorld 2.0Tehtävien tekeminen tietokoneen käyttöliittymässä65,7 %72,6 %
AutomationBenchMonivaiheiset automaatiotehtävät18,1 %41,4 %
MRCR v2, 512 000–1 000 000 tokeniaTarvittavan tiedon löytäminen hyvin pitkästä aineistosta73,8 %96,3 %

OSWorldissa Astra sai siis korkeamman pistemäärän tietokoneen käytöstä. OpenAI:n viivesimulaatiossa se suoriutui näistä tehtävistä myös noin 47 prosenttia lyhyemmässä ajassa tehtävää kohti. AutomationBenchissä ero oli suurempi. MRCR-testi taas koskee tiedon löytämistä pitkän tekstin seasta. Kaikki taulukon luvut ovat OpenAI:n raportoimia testituloksia. (OpenAI:n tulokset ja testien kuvaukset)

Tietokoneen käyttö on enemmän kuin ohjeen antamista

Chatbot voi sanoa: ”Avaa taulukko ja paina vasemmalla olevaa painiketta.” Työkaluja käyttävä tekoälyagentti voi joissakin ympäristöissä tehdä nämä vaiheet itse: avata sivun, täyttää lomakkeen, muokata taulukkoa ja tarkistaa ruudulta, mitä tapahtui.

Tämä tekee tekoälystä hyödyllisemmän esimerkiksi asiakastietojen päivittämisessä tai raportin kokoamisessa. Samalla virheen merkitys kasvaa. Väärä vastaus keskustelussa on eri asia kuin väärän tietueen muuttaminen oikeassa ohjelmassa. Siksi työkalujen käyttöön tarvitaan selvät rajat ja lopputuloksen tarkistus.

Pitkän työn aikana pitää muistaa alkuperäinen tavoite

Kuvittele, että olet pyytänyt 30-sivuisen raportin. Kesken työn kysyt, miksi malli käytti tiettyä lähdettä, ja pyydät muuttamaan yhtä taulukkoa. Hyvän avustajan pitäisi vastata kysymykseen, tehdä muutos ja jatkaa raporttia.

OpenAI:n mukaan Astra on tässä aiempaa parempi: se osaa käsitellä sivukysymyksiä ja uusia ohjeita kadottamatta laajempaa tavoitetta. Tämä on olennainen kyky silloin, kun tehtävä kestää pitkään eikä valmistu yhdellä vastauksella. Se ei silti poista tarvetta tarkistaa, että alkuperäiset vaatimukset todella täyttyivät. (OpenAI:n julkaisu)

Suuri konteksti ei ole sama asia kuin hyvä muisti

Konteksti-ikkuna tarkoittaa karkeasti sitä määrää tekstiä ja muuta aineistoa, jota malli voi käsitellä samalla kertaa. Token on tekstin pieni osa, jolla ikkunan kokoa mitataan.

Ajattele pöytää, jolle levitetään tuhat sivua papereita. Pöydän koko kertoo, mahtuvatko ne kaikki siihen. Se ei vielä kerro, löytääkö apulainen oikean lauseen oikealta sivulta. OpenAI:n MRCR-testin luvut viittaavat siihen, että Astra löytää tietoa hyvin pitkästä aineistosta GPT-5.6 Solia paremmin.

”Pitkä muisti” on silti hieman harhaanjohtava ilmaus. Suuri konteksti-ikkuna ei ole rajaton tai pysyvä muisti, eikä korkea testipistemäärä takaa, että malli huomaa jokaisen tärkeän yksityiskohdan. (OpenAI:n testitulokset)

Mallin pitää ymmärtää myös, mihin annoit luvan

Jos sanot ”poista nämä kolme tiedostoa”, ohje ei tarkoita ”poista koko kansio”. Kun tekoäly käyttää oikeita ohjelmia, sen on erotettava tavoite niistä toimista, joihin sillä todella on lupa.

OpenAI kertoo kehittäneensä Astraa noudattamaan tehtävän rajoja paremmin. Sen julkaisemassa sisäisessä arvioinnissa verrattiin esimerkiksi sitä, yrittääkö malli laajentaa tehtävää valtuutetun kohteen ulkopuolelle. Testitulos tukee parannusta, mutta yksittäisen käyttäjän kannattaa silti määritellä oikeudet selvästi ja tarkistaa tärkeät muutokset. (OpenAI:n julkaisu)

Mitä ”ajattelu ilman sanoja” oikeastaan tarkoittaa?

Otetaan tuttu lasku: 37 × 24 + 19 = 907. Välivaiheet voi kirjoittaa näkyviin:

37 × 24 = 888
888 + 19 = 907

Vaikeammassa tehtävässä tekoälymalli voi tuottaa itselleen paljon tällaisia tekstimuotoisia välivaiheita ennen lopullista vastausta. Tätä kutsutaan päättelyketjuksi (chain of thought). Se muistuttaa luonnospaperia: aiempi merkintä auttaa seuraavan vaiheen tekemisessä. Päättelyketju ei tavallisesti näy käyttäjälle sellaisenaan.

Mutta tekstimuotoiset vaiheet ovat vain yksi osa kokonaisuutta. Kielimallin sisällä tietoa käsitellään numeroina. Voit kuvitella suuren joukon liukusäätimiä: niiden arvot muuttuvat laskennan aikana, ja eri yhdistelmät kantavat erilaista tietoa. Vertaus on karkea, mutta se auttaa ymmärtämään, miksi jokaisen sisäisen vaiheen ei tarvitse olla lause.

Piilotettu numeerinen laskenta ei ole Astran keksintö. Vanhemmatkin kielimallit tekivät sitä ennen seuraavan sanan tuottamista. Kiinnostava havainto Astrasta on, että OpenAI:n turvallisuusarvioinnissa se pystyi ratkaisemaan aiempia malleja enemmän tehtäviä myös silloin, kun tekstimuotoinen päättelyketju oli kytketty pois. Tämä ei tarkoita, että Astra ei koskaan käyttäisi päättelyketjua. (OpenAI:n turvallisuusarviointi)

Laskin on tässä rajallinen mutta hyödyllinen vertaus. Se antaa tuloksen kirjoittamatta jokaista välivaihetta ruudulle. Tekoälymalli on paljon monimutkaisempi, eikä siitä pidä päätellä, että se ajattelisi ihmisen tavoin. Vertaus kertoo vain, että laskenta ja sen näkyvä sanallinen kuvaus ovat eri asioita.

Miten sanatonta päättelyä on tutkittu?

Tutkijat ovat kokeilleet useita tapoja antaa mallille lisää laskentaa ilman pitkää tekstimuotoista päättelyketjua. Alla olevat menetelmät ovat erillisiä tutkimusideoita, eivät luettelo Astran tunnetuista rakennusosista.

Vaihe tai ideaMitä tapahtuu?Helppo vertaus
Aiemmat kielimallitMalli tekee sisäistä numeerista laskentaa ennen seuraavaa tekstin osaa.Mietit hetken ja vastaat.
Tekstimuotoinen päättelyketjuMalli kirjoittaa välivaiheita, joita se voi käyttää jatkossa.Käytät luonnospaperia.
Pause token -tutkimusMallille annetaan opittuja taukomerkkejä ja lisää laskentaa ennen vastausta.Pidät pienen miettimistauon.
COCONUTMallin sisäistä tilaa syötetään takaisin ilman, että se ensin muutetaan sanaksi.Käsittelet ajatusta sanomatta sitä ääneen.
Recurrent depthSama laskentalohko käsittelee sisäistä tilaa toistuvasti.Palaat ongelmaan vielä kerran ennen vastaamista.
Astraa koskeva havaintoMalli ratkaisee aiempaa enemmän tehtäviä ilman tekstimuotoista päättelyketjua.Tarvitset vähemmän näkyvää luonnospaperia.

Pause tokenit: lisää aikaa ennen vastausta

Vuonna 2023 julkaistussa Think Before You Speak -tutkimuksessa mallia opetettiin käyttämään erityisiä taukomerkkejä ennen vastausta. Merkit eivät ole kirjaimellisia ohjeita ”mieti vielä”, vaan osa mallin käsittelemää syötettä. Ne antavat sille lisää laskenta-askelia ennen varsinaisen vastauksen tuottamista. Tutkijat raportoivat parannuksia useissa testitehtävissä, kun mallia myös koulutettiin tähän tapaan. (Tutkimus)

COCONUT: välivaiheen ei tarvitse olla sana

Vuonna 2024 esitelty COCONUT tutki toista ideaa. Tekstimuotoisessa päättelyketjussa malli tuottaa välivaiheeksi sanoja ja käyttää niitä seuraavan vaiheen syötteenä. COCONUTissa mallin sisäinen numeerinen tila voidaan syöttää suoraan takaisin seuraavaksi vaiheeksi. Jokaisen välivaiheen ei siis tarvitse muuttua ihmiskieleksi. Tutkijat kutsuivat tätä continuous thought -lähestymistavaksi. (Tutkimus)

Recurrent depth: samaa tilaa käsitellään uudelleen

Vuonna 2025 julkaistu recurrent depth -tutkimus kokeili mallia, jossa laskennan osaa voidaan toistaa useita kertoja ennen vastausta. Malli saa näin lisää laskentaa ilman, että sen on välissä kirjoitettava lisää tekstimuotoisia päättelyaskelia. Tutkijat esittivät tästä toimivan kokeellisen mallin. (Tutkimus)

Käyttääkö Astra jotakin näistä tekniikoista?

Emme tiedä. Julkiset testit kertovat, mihin Astra pystyy tietyissä oloissa. Ne eivät paljasta yksityiskohtaisesti, millä rakenteella tulos saavutetaan. Parempi koulutus, erilaiset sisäiset esitykset ja muut tekniset ratkaisut voivat kaikki vaikuttaa.

Siksi ei olisi perusteltua sanoa, että ”Astra käyttää COCONUTia” tai ”Astra toimii recurrent depthilla”. Nämä tutkimukset auttavat ymmärtämään mahdollisia suuntia, mutta ne eivät todista mitään Astran toteutuksesta.

Miksi tällä on väliä, ja mikä siinä on hankalaa?

Ihmiskieli on hyvä tapa kertoa toiselle ihmiselle, mitä teemme. Se ei välttämättä ole tehokkain muoto jokaiselle koneen sisäiselle välivaiheelle. Kuvan jokaista pikseliä ei tarvitse kuvailla lauseella, jotta malli voi käsitellä kuvaa. Samoin kaikkea päättelyssä tarvittavaa tietoa ei välttämättä tarvitse kirjoittaa sanoiksi.

Toinen puoli on tulkittavuus: miten voimme selvittää, miksi malli päätyi tiettyyn vastaukseen tai teki tietyn toiminnon? Jos tekstimuotoisia välivaiheita on vähemmän, niistä saa vähemmän vihjeitä. Eikä näkyvä selitys muutenkaan ole täydellinen ikkuna mallin sisäiseen laskentaan.

OpenAI:n turvallisuusarvioinnissa Astran päättelyketju oli aiempaa lyhyempi ja joissakin tarkasteluissa vaikeammin valvottava. Mallin tekemiä toimia ja työkalujen käyttöä voidaan myös tarkastella, mutta ne eivät aina kerro, miksi tekoäly toimi niin kuin toimi. Mitä enemmän vastuuta tekoälylle annetaan, sitä tärkeämmiksi tulevat selkeät käyttöoikeudet, tarkistettavat lähteet ja tehdyn työn läpikäynti. (OpenAI:n turvallisuusarviointi)

Mikä Astrassa siis muuttuu?

Aiempi painotusAstran kohdalla korostuva suunta
Tekoäly antaa vastauksen tai ohjeen.Tekoäly voi tehdä useita vaiheita kohti valmista tuotosta.
Käyttäjä ohjaa työtä vaihe vaiheelta.Malli voi suunnitella ja toteuttaa enemmän välivaiheita annetuilla työkaluilla.
Työkalujen käyttö on yksi erillinen kyky.Selaimen, taulukon ja muiden ohjelmien käyttö on osa työnkulkua.
Suuri aineisto mahtuu käsiteltäväksi.Olennaisen tiedon löytäminen suuresta aineistosta korostuu.
Tekstimuotoinen päättelyketju auttaa vaikeissa tehtävissä.Malli selviytyy aiempaa useammista tehtävistä myös ilman pitkää ketjua.
Yksi vastaus päättää usein tehtävän.Järjestelmä voi jatkaa, tarkistaa ja korjata, kunnes työ on valmis.

Mitä muutos tarkoittaa käytännössä?

Voit kertoa tekoälylle suoraan, minkä lopputuloksen haluat saavuttaa, ja se voi hoitaa suuren osan tarvittavista välivaiheista itsenäisesti.

Tämä edellyttää, että tekoälyllä on tehtävään sopivat työkalut, tarvittavat tiedot ja oikeudet toimia.

Ihmisen vastuuta tämä ei kuitenkaan poista. Lopputulos ja tehdyt toimet on edelleen hyvä tarkistaa: ovatko tiedot oikein, onko tehtävä toteutettu tarkoituksen mukaisesti ja ovatko tehdyt toimet pysyneet sovituissa rajoissa?