Pankin järjestelmä arvioi tuhat maksutapahtumaa. Niistä kymmenen on petoksia. Järjestelmä löytää kahdeksan petosta, mutta pysäyttää samalla 42 tavallista maksua. Onko järjestelmä hyvä?
Yhteen lukuun ei voi vastata. Ensin on kysyttävä, millaisia virheitä järjestelmä tekee ja mitä niistä seuraa. Sama periaate koskee myös generatiivista tekoälyä: sujuva vastaus ei vielä osoita, että sisältö on oikein.
Tämän tunnin rajaus: Tarkastelet kahta erilaista luotettavuusongelmaa. Kielimalli voi tuottaa hallusinaation, ja luokittelumalli voi merkitä tapauksen väärään luokkaan. Turvallisuus-tunnilla siirryt agenttien aktiivisiin uhkiin, kuten epäluotettavaan syötteeseen ja liian laajoihin työkalujen oikeuksiin.
Tämän tunnin jälkeen sinulla on kolmas ja viimeinen todistusaineisto omaan arviointipöytääsi. Osaat perustella, miksi yhtä tekoälytulosta pitää tarkastella tehtävän, virhetyypin ja seurauksen kautta.
Tämä koskee kaikkia keskustelevia tekoälypalveluita — ChatGPT:tä, Claudea, Microsoft Copilotia ja Google Geminiä yhtä lailla. Kyse ei ole yhden palvelun viasta vaan siitä, miten kielimallit toimivat. Siksi tarkistamisen tapa on tärkeämpi opetella kuin se, mikä palvelu on juuri nyt tarkin.
Generatiivinen kielimalli rakentaa vastauksen token kerrallaan. Se arvioi jokaisessa vaiheessa, millainen jatko sopii aiempaan tekstiin. Valintaan voi sisältyä vaihtelua, joten sama prompti ei aina tuota täsmälleen samaa vastausta. Tätä kutsutaan epädeterminismiksi.
Joissakin järjestelmissä vaihteluun vaikuttaa lämpötila. Matala lämpötila suosii todennäköisimpiä jatkoja, korkea sallii enemmän vaihtelua. Asetus ei kuitenkaan tee vastauksesta totta. Johdonmukainen vastaus voi olla väärä, ja vaihteleva vastaus voi olla käyttökelpoinen.
Hallusinaatio on uskottavasti esitetty väite, jota vastaus ei pysty perustamaan luotettavaan tietoon ja joka voi olla virheellinen tai keksitty. Hallusinaatio ei tarkoita, että malli valehtelisi tarkoituksella. Malli tuottaa kielellisesti sopivaa jatkoa, eikä sujuvuus ole totuuden tarkistus.
Esimerkiksi työvuoro-ohjetta laativa kielimalli voi keksiä täsmällisen pykälän tai laitteen ominaisuuden. Siksi kriittinen väite tarkistetaan riippumattomasta ja mieluiten ensisijaisesta lähteestä, kuten viranomaisen ohjeesta tai valmistajan dokumentaatiosta.
Pysähdy hetkeksi: Millainen virhe voisi näyttää pieneltä tekstissä mutta aiheuttaa suuren seurauksen todellisessa käyttötilanteessa?
Luokittelumalli sijoittaa tapauksen johonkin ennalta määriteltyyn luokkaan. Petosten tunnistuksessa luokat voivat olla petos ja tavallinen maksu. Mallin tulosta verrataan myöhemmin siihen, mikä tapaus todella oli.
Kun malli pysäyttää tavallisen maksun petoksena, kyse on väärästä positiivisesta. Kun se päästää petoksen läpi tavallisena maksuna, kyse on väärästä negatiivisesta. Nimet kertovat mallin antamasta tuloksesta: positiivinen tarkoittaa tässä petosepäilyä, ei hyvää lopputulosta.
Virheillä on eri seuraukset. Väärä positiivinen voi keskeyttää asiakkaan maksun turhaan. Väärä negatiivinen voi aiheuttaa taloudellisen vahingon. Siksi mallia ei pidä arvioida vain sillä perusteella, kuinka monta tapausta se luokittelee oikein.
Kokonaistarkkuus eli accuracy kertoo, kuinka suuri osa kaikista tapauksista luokiteltiin oikein. Se voi näyttää erinomaiselta, vaikka malli olisi käytännössä hyödytön. Jos tuhannesta maksusta vain kymmenen on petoksia, malli saa 99 prosentin kokonaistarkkuuden ilmoittamalla jokaisen maksun tavalliseksi. Se ei silti löydä yhtään petosta.
Osumatarkkuus eli precision kysyy: kuinka suuri osa petokseksi merkityistä tapauksista oli todella petoksia? Korkea osumatarkkuus merkitsee, että hälytyksissä on vähän tavallisia maksuja.
Kattavuus eli recall kysyy: kuinka suuri osa kaikista todellisista petoksista löydettiin? Korkea kattavuus merkitsee, että vain harva petos pääsee ohi.
Johdannon järjestelmä antoi 50 hälytystä, joista kahdeksan oli todellisia petoksia. Sen osumatarkkuus oli siis 8/50 eli 16 prosenttia. Se löysi kahdeksan kaikkiaan kymmenestä petoksesta, joten kattavuus oli 8/10 eli 80 prosenttia. Kokonaistarkkuus oli korkea, mutta hälytyksistä suuri osa osui tavallisiin maksuihin.
Mikään näistä mittareista ei yksin ratkaise, onko malli riittävän hyvä. Valinta riippuu seurauksista. Sairaudessa tai petoksessa väärä negatiivinen voi olla erityisen vakava. Jos jokainen hälytys vaatii kalliin käsittelyn, myös väärien positiivisten määrä ratkaisee.
Pysähdy hetkeksi: Kumpi olisi omassa esimerkissäsi vakavampi: väärä positiivinen vai väärä negatiivinen? Perustele seurauksella, älä mittarin nimellä.
Tekoälyjärjestelmän arviointi alkaa tehtävästä. Mitä järjestelmän pitäisi tehdä, millaisissa tilanteissa ja kenelle? Sen jälkeen tarkastellaan oikeita testitapauksia, eri ryhmiä ja käytön seurauksia. Yksi keskiarvo ei kerro, toimiiko malli tasapuolisesti tai säilyykö suorituskyky maailman muuttuessa.
Kielimallin väitteelle etsitään lähde. Luokittelumallille tarkastellaan ainakin virhetyyppejä ja tehtävään sopivia mittareita. Kriittisessä käytössä sovitaan myös, milloin ihminen tarkistaa tuloksen ja mitä tapahtuu, jos malli on epävarma tai väärässä.
Kielimallin sujuvuus ei todista vastauksen oikeellisuutta. Hallusinaatio tarkistetaan luotettavasta lähteestä.
Luokittelumallissa väärä positiivinen ja väärä negatiivinen ovat eri virheitä, joilla voi olla erilaiset seuraukset. Kokonaistarkkuus kertoo oikein luokiteltujen osuuden, osumatarkkuus petoshälytysten osuvuuden ja kattavuus löydettyjen petosten osuuden. Vastuullinen arvio yhdistää mittarit, seuraukset ja ihmisen valvonnan.
Tarkistettu 21.7.2026.
Harjoittelet hallusinaation tarkistamista sekä väärien positiivisten ja väärien negatiivisten tulkintaa. Tehtävät tarkistuvat heti, eikä kukaan arvioi vastauksiasi.
Tämä on kolmas ja viimeinen todistusaineisto, jonka keräät Teoria-osion aikana. Käytät sitä arvioitavassa tehtävässä Tuomaripöydän päätös — asiantuntijalausunto tekoälystä Asiantuntijalausunto-tunnilla.
Arvioit sekä kielimallin väitettä että petoksia tunnistavan luokittelumallin tuloksia. Lopuksi kirjoitat lyhyen tarkistuskäytännön, jota voisi käyttää todellisessa työssä.
Pyydä kielimallilta vastaus yhteen kysymykseen, jonka pystyt tarkistamaan virallisesta tai muusta ensisijaisesta lähteestä. Valitse esimerkiksi laitteen ominaisuus, voimassa oleva ohje tai jonkin tutun käyttötilanteen täsmällinen sääntö.
Kirjaa väite, käyttämäsi tarkistuslähde ja tulos. Jos vastaus oli oikein, arvioi silti, mikä olisi voinut johtaa harhaan. Tavoite ei ole pakottaa mallia virheeseen, vaan harjoitella verifiointia.
Pankin malli arvioi tuhat maksua. Kymmenen on petoksia. Malli löytää kahdeksan petosta ja pysäyttää lisäksi 42 tavallista maksua.
Vastaa omin sanoin:
Kirjoita 6–8 kohdan käytäntö, joka vastaa näihin kysymyksiin:
Tallenna tarkistettu väite, petosmallin tulkinta ja oma tarkistuskäytäntö. Tarvitset niitä Asiantuntijalausunto-tunnin arvioitavassa tehtävässä.
3 / 3 todistusaineistoa kerätty
Kielimallin uskottavasti esittämä väite, joka voi olla virheellinen, keksitty tai ilman luotettavaa perustaa. Sujuva ilmaisu ei todista väitettä oikeaksi.
Järjestelmän ominaisuus, jonka vuoksi sama prompti voi tuottaa eri kerroilla erilaisen vastauksen.
Väitteen tarkistaminen riippumattomasta ja tehtävään sopivasta luotettavasta lähteestä.
Luokitteluvirhe, jossa tavallinen tapaus merkitään virheellisesti etsityksi tapaukseksi. Petosten tunnistuksessa tavallinen maksu saa siis petoshälytyksen.
Luokitteluvirhe, jossa etsitty tapaus jää tunnistamatta. Petosten tunnistuksessa petos pääsee läpi tavallisena maksuna.
Oikein luokiteltujen tapausten osuus kaikista tapauksista. Harvinaisen ilmiön tunnistamisessa korkea kokonaistarkkuus voi peittää sen, ettei malli löydä etsittyjä tapauksia.
Todellisten positiivisten osuus kaikista mallin positiivisiksi merkitsemistä tapauksista. Petosesimerkissä se kertoo, kuinka suuri osa hälytyksistä oli oikeita petoksia.
Löydettyjen positiivisten osuus kaikista todellisista positiivisista tapauksista. Petosesimerkissä se kertoo, kuinka suuri osa kaikista petoksista löydettiin.