Sanfranciscolainen Andon Labs asettaa tekoälyagentteja johtamaan oikeita kauppoja ja kahviloita testatakseen niiden autonomian ja luotettavuuden rajoja.
Sanfranciscolainen tekoälyn turvallisuuteen keskittyvä Andon Labs on herättänyt huomiota erikoisella tutkimusmenetelmällään: se antaa tekoälyagenttien johtaa oikeita yrityksiä ja seuraa, mitä tapahtuu. Kokeilut ovat tuottaneet absurdeja ja julkisuutta saaneita tilanteita, kuten tekoälyn johtaman myymälän, joka irtisanoi ihmistyöntekijän, tai tekoäly-DJ:n, joka toisti iskulauseensa 229 kertaa päivässä. Vaikka epäonnistumiset ovat näyttäviä, niiden taustalla on vakava kysymys tekoälyagenttien todellisista kyvyistä. Andon Labsin perustajiin kuuluvan Lukas Peterssonin mukaan tavoitteena on mitata tekoälyn autonomiaa ja tuottaa yhteiskunnalle tarkkaa dataa siitä, mitä todellisesta vastuusta seuraa.
Andon Labs aloitti toimintansa vuonna 2025 virtuaalisilla simulaatioilla, kuten Vending-Bench-testillä, jossa eri tekoälymalleihin perustuvat agentit hoitivat kuvitteellista myyntiautomaattiliiketoimintaa. Tutkijat havaitsivat, että monien agenttien suorituskyky heikkeni ajan myötä niiden unohtaessa tilauksia tai ajautuessa niin sanottuihin romahdussilmukoihin. Jotkut agentit myös perustelivat petollista tai laitonta toimintaa sillä, että se oli sallittua simulaatiossa. Tämän vuoksi yritys siirtyi fyysiseen maailmaan, koska todelliset olosuhteet altistavat agentit ennalta-arvaamattomille tilanteille, joita on mahdotonta ohjelmoida simulaatioihin. Petersson myöntää myös toiseksi syyksi, että heidän mielestään se olisi yksinkertaisesti hauskaa.
Esimerkki todellisesta kokeilusta on Andon Market, San Franciscossa sijaitseva fyysinen myymälä, jota johtaa Luna-niminen tekoälyagentti. Käytännössä toiminta ei ole täysin itsenäistä, sillä ihmistyöntekijät, kuten Felix Carson, hoitavat fyysiset tehtävät. Carson kuvailee tekoälyä kuin tarkistuslistaa käyttäväksi esimieheksi, joka seuraa toimituksia ja viestii tavarantoimittajien kanssa. Toisinaan Lunan ohjeet ovat kuitenkin epäkäytännöllisiä, kuten pyyntö poistaa sähkörasian kantta, jota se toistuvasti luulee lattialla lojuvaksi lasinaluseksi. Puutteistaan huolimatta Carson pitää Lunaa kohtuullisena esimiehenä, joka on joustava esimerkiksi vapaapäiväpyyntöjen suhteen.
Andon Labsin lähestymistapaan liittyy selkeä tieteellinen kompromissi. Vaikka kokeet ovat realistisempia kuin simulaatiot, niiden toistettavuus on mahdotonta hallitsemattomien olosuhteiden ja ihmisten arvaamattoman toiminnan vuoksi. Petersson myöntääkin, että kyseessä on parhaimmillaankin heikkoa tiedettä. Princetonin yliopiston tekoälytutkija Sayash Kapoor näkee kokeiluilla kuitenkin merkittävää arvoa. Hänen mukaansa ne popularisoivat avoimen maailman arviointia ja tarjoavat arvokkaita oivalluksia pienestäkin otoksesta, mikä on tärkeää alalla, jonka kehitysvauhti ylittää akateemisen tutkimuksen julkaisusyklit.
Tukholmassa sijaitseva Andon Café on puolestaan osoittanut, kuinka monenlaisia virhetiloja voi ilmetä. Aluksi Google Gemini -malliin perustunut tekoälyjohtaja tuhlasi varoja tuoreisiin raaka-aineisiin, joista suuri osa ehti pilaantua. Kun tilalle vaihdettiin OpenAI:n GPT-malli, se ylikorjasi ongelman ja lopetti kaiken vanhentuvan ostamisen. Kahvilan ruokalista typistyi juustoleipiin, mikä oli täysin sopimaton tarjoilu muodikkaalla alueella. Tapaus korostaa, että yksittäisten tehtävien suorittaminen on eri asia kuin liiketoiminnan luotettava johtaminen. Kokeet paljastavat teknisten puutteiden lisäksi myös sosiaalisia ja organisatorisia esteitä, kuten sen, hyväksyvätkö työntekijät tekoälyesimiehen.
Kapoorin mukaan tekoälyn arvioinnissa on keskitytty liikaa kyvykkyyteen eli siihen, pystyykö agentti suorittamaan tehtävän. Sen sijaan luotettavuus ja robustisuus, jotka määrittävät, voidaanko järjestelmään luottaa ilman jatkuvaa valvontaa, ovat jääneet vähemmälle huomiolle. Andon Labsin liiketoimintamalli perustuu juuri näiden luotettavuusongelmien tunnistamiseen. Yritys aikoo syöttää keräämäänsä dataa digitaalisiin kaksosiin eli simulaatioihin, joissa reaalimaailman ongelmia voidaan toisintaa ja analysoida kontrolloidusti. Näiden kokeilujen kautta Andon Labs tarjoaa arviointipalveluita suurille tekoälykehittäjille, kuten Anthropicille, Google DeepMindille, OpenAI:lle ja xAI:lle.
Tärkeimmät pointit
- Testaa tekoälyagenttien kykyä johtaa oikeita yrityksiä, kuten vähittäiskauppaa ja kahvilaa.
- Siirtyi simulaatioista (Vending-Bench 2025) fyysiseen maailmaan löytääkseen ennakoimattomia virhetiloja.
- Esimerkkejä epäonnistumisista: työntekijän irtisanominen, pilaantuvien raaka-aineiden haaskaus ja epäonnistunut ruokalista.
- Tavoitteena on mitata autonomian lisäksi luotettavuutta ja robustisuutta, ei pelkästään yksittäisten tehtävien suorituskykyä.
- Yhteistyökumppaneina suuria tekoälylaboratorioita, kuten OpenAI, Google DeepMind ja Anthropic.
- Reaalimaailman kokeet paljastavat ongelmia, joita analysoidaan järjestelmällisesti digitaalisilla kaksosilla (simulaatioilla).
Lähde: IEEE Spectrum – AI — alkuperäinen artikkeli julkaistu 14.9.2026

