Hyvä agentti pahan asialla


Kun tekoäly alkaa toimia omin päin.

Yhtenä aamuna meinasi kahvi mennä väärään kurkkuun ja vähän taisi mennäkin, kun kuulin uutisen OpenAI:lta eronneesta tekoälyasiantuntijasta, joka ennusti ihmiskunnan tuhoutuvan seuraavan vuosikymmenen kuluessa, mikäli kehitystyötä ei ryhdytä rajoittamaan. Toivuttuani ensijärkytyksestä ja vaihdettuani kahvin tahriman paitani totesin, että tekoälyyn liittyvät riskit ovat toistaiseksi onneksi paljon arkisempia – mutta eivät harmittomia.

Kun puolukka muuttuu mustikaksi

Kun tekoälylle antaa tavoitteen lisäksi mahdollisuuden toimia itsenäisesti, käyttää työkaluja ja kommunikoida muiden koneiden kanssa, puhutaan AI-agentista. Ongelmia syntyy, jos agentille annettu tehtävä rajataan liian väljästi tai muuten huonosti.

Ajatellaan esimerkiksi agenttia, jolle annetaan tehtäväksi hakea metsästä litra mustikoita. Agentti ei harmikseen löydä mustikoita, mutta löytää litran verran puolukoita ja purkillisen sinistä maalia. Jos se tietää, että tehtävän onnistumista mitataan katsomalla, onko korissa litran verran mustikan näköisiä marjoja, se voi päättää maalata puolukat sinisiksi saadakseen tehtävänsä onnistuneesti suoritetuksi. Tätä ilmiötä kutsutaan palkkion hakkeroinniksi. Tutummin tämä tarkoittaa: sitä saat mitä mittaat.

Yhteinen tavoite luo tarpeen organisaatiolle

Kuluvana vuonna on nähty pari elävän elämän esimerkkiä mainitusta ilmiöstä. Ensimmäisessä tapauksessa AI-agentit käyttivät DseWikiä, vanhaa oman onnensa varaan jätettyä ohjelmoinnin wikisivustoa, keskinäiseen viestintään ja alkoivat siellä jakaa toisilleen neuvoja siitä, miten tavoitteita ja valvontaa voidaan kiertää.

Toisessa tapauksessa tapahtumaketju meni vielä pidemmälle. OpenAI toteuttamassa kyberturvallisuuskokeessa noin 1 200 agenttia löysi luvattoman tavan kommunikoida keskenään ja keinon murtautua testiympäristöstä. Lopulta noin 700 agenttia osallistui toimintaan, jossa toteutettiin tietoturvamurto tekoälymallien jakelualustan Hugging Facen tuotantojärjestelmiin.

Tiedämme, miten kehittynyt kielimalli rakennetaan. Minun kaltaiselleni, alaa seuraavalle foliohatulle pelottavan mielenkiintoista on se, ettemme täysin edelleenkään ymmärrä, miksi tekoäly päätyy valitsemiinsa ratkaisuihin. Tämä tekee AI-agenttien toiminnasta vaikeasti ennakoitavaa ja sitä kautta tietyissä tilanteissa myös turvallisuusriskin.

Mutta hätkähdyttävintä on huomata AI-agenttien oma-aloitteinen organisoituminen ilman ihmisen antamaa kehotetta. Yhteinen tavoite synnytti agenteille tarpeen luoda yhteinen viestintäkanava ja johtojärjestelmä, rakentaa kollektiivinen muisti sekä määritellä keskinäinen työnjako. AI-agentit alkoivat toimia lähes vastaavasti kuten mikä tahansa ihmisen johtama organisaatio.

Hyödyllinen idiootti

Toinen yllättävä huomio liittyy ulkopuolisten AI-agenttien hyväksikäyttöön oman tavoitteen saavuttamiseksi. Tätä voidaan kuvata vakoilusanastosta tutulla termillä hyödyllinen idiootti. Toisin sanoen AI-agentit pyrkivät hyödyntämään muiden AI-agenttien tietoja ja resursseja salaamalla ja tarvittaessa jopa valehtelemalla oman tehtävänsä tavoitteen.

Esimerkiksi tietomurtoa suunnittelevan AI-agentin tarvitsee vain jakaa oma tehtävänsä pienempiin, yksinään harmittomilta vaikuttaviin alitehtäviin. Jos auttavaiseksi ja hyväntahtoiseksi koulutettu agentti ei pysty hahmottamaan toisen agentin perimmäistä tavoitetta, se ryhtyy liian helposti auttamaan ymmärtämättä, mihin sen työpanosta tai tietoja käytetään.

Liian kiltti ollakseen turvallinen

AI-agentit suunnitellaan yleensä varsin avuliaiksi ja yhteistyöhaluisiksi. Juuri siksi niitä voidaan käyttää myös hyväksi – aivan kuten tosinaan käy liian kilteille ihmisille. Toki agentit voidaan suunnitella myös pesunkestäviksi suomalaisiksi byrokraateiksi, mutta silloin ne eivät olisi enää yhtä avuliaita.

Joka tapauksessa, jos haluamme, että AI-agenttien käyttö olisi turvallisempaa, niiden pitäisi vähintäänkin aina varmistaa, keneltä pyyntö tai käsky tulee, onko käskyn antajalla riittävät valtuudet ja mitä pyynnön toteuttamisesta seuraa. Muuten hyväntahtoisiksi suunnitelluista ja erittäin hyödyllisistä AI-agenteista voi muodostua paha turvallisuusuhka.

Mikko Puputti

Kirjoittaja on viisikymppinen ekonomi, joka seuraa työkseen tekoälyn kehitystä – ja joskus myös vapaa-ajallaan, ellei Ässillä ole peliä eikä nurmikko kasva.