Asiakastarina:

Kun vianetsintä muuttui tunneista minuuteiksi

Miten rakensimme AI Ops -ratkaisun, joka analysoi kriittisen järjestelmän lokeja puolestamme – ja mitä opimme matkan varrella.

Lähtökohta

Asiakkaallamme on suuri, hajautettu IT-järjestelmä, joka on kriittinen osa heidän päivittäistä liiketoimintaansa. Järjestelmällä on satoja päivittäisiä käyttäjiä, ja kuten missä tahansa laajassa ympäristössä, ongelmia syntyy jatkuvasti – suuria ja pieniä.

Haaste ei ollut suurissa häiriöissä, joihin reagoitiin aina nopeasti. Haaste oli kaikessa siinä välissä: pienemmissä, arkisissa ongelmissa, joiden juurisyyn löytäminen valtavasta lokimassasta oli hidasta ja työlästä. Usein ongelman todellinen laajuus ei ollut lähelläkään sitä työmäärää, joka sen ratkaisemiseen kului. Tämä nosti kynnystä tarttua pienempiin vikoihin, mikä puolestaan näkyi suoraan loppukäyttäjien kokemuksessa järjestelmän laadusta.

Tavoite oli selkeä: madaltaa kynnystä korjata myös pienemmät ongelmat, parantaa loppukäyttäjäkokemusta – ja pitää samalla ongelmien raportoinnin kynnys matalana.

Ratkaisu: kielimallipohjainen logianalyysiagentti

Rakensimme agentin, jonka tehtävä on analysoida järjestelmän tuottamia lokivirtoja vianetsinnän näkökulmasta ja koostaa löydöksistä selkeän, luettavan yhteenvedon. Agenttia voi käyttää kolmella tavalla, tilanteen mukaan:

  • Ajastettuna – joka aamu ennen työpäivän alkua agentti tuottaa raportin edellisen päivän aikana havaituista poikkeamista.

  • Hälytyksen laukaisemana – kun valvontatyökalu havaitsee poikkeaman, agentti käynnistyy automaattisesti analysoimaan tilannetta.

  • Ad hoc -periaatteella – tarpeen vaatiessa, esimerkiksi kun loppukäyttäjä raportoi ongelman suoraan.

Agentti osaa myös kerätä havainnoista historiadataa ja verrata siihen uusia löydöksiä. Näin se pystyy päättelemään, onko kyse uudesta ongelmasta vai jo useamman päivän ajan toistuneesta ilmiöstä.

Mitä tällä saavutettiin

Suurin osa vianselvityksen kokonaisajasta kuluu tyypillisesti siihen, että ongelman juurisyy ensin paikannetaan. Kun käyttäjä ilmoittaa esimerkiksi, ettei jokin toiminto toimi, voi vastauksen löytäminen ison järjestelmän lokimassasta viedä ihmiseltä pahimmillaan useita tunteja.

Kielimallipohjaiselle agentille sama tehtävä ei ole samassa mittakaavassa urakka: vastaava päättely tapahtuu tuntien sijaan minuuteissa. Agentti koostaa löydöksistä lyhyessä ajassa selkeän raportin ja pystyy tunnistamaan eri lokivirtojen välisiä syy-seuraussuhteita – myös sellaisia, jotka saattaisivat jäädä kokeneeltakin ylläpitäjältä huomaamatta. Kun ongelma sitten tulee eteen, operoijalla on heti käytössään huomattavasti parempi lähtökohta nopeaan ratkaisuun.

Agentin voi tarvittaessa kytkeä myös relevantteihin ulkoisiin tietolähteisiin, jolloin se ei ainoastaan raportoi ongelmia vaan pystyy myös ehdottamaan niihin ratkaisuja.

Mitä opimme

  • Kielimallit ovat vahvoilla juuri tekstimuotoisen datan – kuten lokien – kanssa. Kyky löytää syy-seuraussuhteita eri lokivirtojen välillä ja yhdistää siihen sekä mallin sisäänrakennettua tietoa että ulkoisia lähteitä yllätti meidät positiivisesti.

  • Agentti on vasta puolet ratkaisusta. Jotta tällaisesta agentista saa parhaan hyödyn, jatkuva kehitys ja löydösten prosessointi on välttämätöntä. Agentin tuottamien havaintojen määrä voi yllättää ja kaikilla organisaatioilla ei automaattisesti ole valmiutta lähteä korjaamaan kaikkea, mitä agentti nostaa esiin. Tämä on syytä huomioida jo käyttöönottoa suunniteltaessa.

Tämä on yksi esimerkki siitä, miten rakennamme toimivia, tuotantokäytössä testattuja AI Ops -ratkaisuja asiakkaillemme. Jos pohdit, missä teidän organisaationne hyötyisi vastaavasta – jutellaan.


Tommi Tuomisto

Kirjoittaja

Tommilla on vuosien monialainen kokemus DevOps- prosesseista ja hän tutkii parhaillaan AI:n hyödyntämistä osana työnkulkuja. Tommin syväosaamista on liiketoimintakriittiset ympäristöt.

Tommi Tuomisto