Project Organisation Helsinki

Varo tekoälyn myyjälukkoa

Tekoälyn suosio on voimakkaasti kasvanut viime vuosina. Kehittyvässä markkinatilanteessa suuret toimijat myyvät palvelua tappiolla kasvattaakseen markkinaosuuttaan ja karkottaakseen kilpailijat. Asiakkaat saattavat tulla riippuvaisiksi yhdestä toimittajasta, joka määräävään markkina-asemaan päästyään voi sanella hintansa.

Myyjälukon lisäksi voi laueta sääntelyriski, joka estää joidenkin kielimallien toimituksen joillekin markkina-alueille.

Valitse järkevä, tehokas mittari

Generatiivisen tekoälyn käytön tavanomainen yksikkö on token eli pieni määrä tietoa, kuten sanoja, sanan osia, merkkejä tai kuvapistejoukkoja, joita tekoälymalli käsittelee sekä koulutuksen että päättelyn aikana.

Olisiko token-hinta järkevä mittari? Ehkä jollekin tietylle algoritmille ja syötetyypille. Se on karkeasti verrattavissa perinteisen infrastruktuuripalvelun laskutukseen, jossa maksetaan suoritetuista konekielikäskyistä tai suoritintunneista.

Infrastruktuuripalveluntarjoaja voisi laskuttaa uudemman sukupolven keskusyksiköstä 30% enemmän suoritintunnilta. Jos sovelluksesi toimii 20% nopeammin uudessa ympäristössä, vaihto maksaisi noin 8% enemmän (1.20/1.30≈0.92). Lisähinnalla saisi hieman nopeamman vasteajan ja lisää kasvunvaraa ja siten paremman käyttökokemuksen. Jos sovelluksen optimointi hyödyntämään uuden alustan käskylaajennuksia toisi 50% lisää suorituskykyä, kustannustehokkuus paranisi 15% (1.50/1.30≈1.15).

Se, montako suorittimen kellojaksoa tehtävän suorittamiseen kuluu, riippuu suuresti rinnakkaisuuden asteesta (vektorikäskyistä tai monisäikeisyydestä) sekä muistiviittausten hajonnasta suoritusaikana. Vastaavasti se, mitä jollakin token-määrällä voidaan saada aikaan, riippuu käytetystä tekoälymallista, käytettävissä olevasta muistitilasta sekä tarvittavan asiayhteyden laajuudesta.

Siksi on mielekästä mitata kustannustehokkuutta todellisissa käyttötilanteissa eikä valita mallia, joka näyttää parhaalta jossakin vertailussa, joka mahdollisesti tehtiin jonkin toimittajan toimeksiannosta.

Suhtaudu varauksella julkisiin vertailuihin

Ulkoisiin tulostaulukoihin luottaminen vaarantaa toimintasi kolmella tavalla:

Väärä suorituskykyarvio
Julkiset tulokset mitataan toimittajan laiteympäristössä, joka voi laskea tarkemmin kuin paikallinen tuotantoympäristösi; haluathan pitää tietosi suojattuina. Kvantisointikohinattomassa pilviympäristössä erinomaisesti toimiva malli voi toimia paljon huonommin muualla.
Tietojen saastuminen
Jos suositut suorituskykyvertailut päätyvät uusien mallien koulutusaineistoon, ne mittaavat muistamista eivätkä päättelyä. Malleille on annettava uusia tehtäviä, joita ne näkevät ensi kertaa.
Kerralla oikein -virhepäätelmä
Monissa vertailuissa tutkitaan, kuinka hyvää ohjelmakoodia malli saa aikaan yhdellä yrityksellä. Ohjelmistotekniikka etenee kuitenkin askeleittain (kirjoita → käännä → testaa → korjaa). On mitattava mallin kykyä korjata toimintaansa kääntäjän ilmoitusten perusteella.

Siirry toimittajan väittämästä kyvystä todennettuun tuotantoon

Olemme kehittämässä eristettyä kielimallien arviontiympäristöä. Ratkaisevaa on eheyspisteiden vähentäminen malleilta, jotka tuottavat vakuuttavia mutta vääriä vastauksia — anteeksiantamaton vikatila automaattisessa infrastruktuurin hallinnassa.

Meillä on suljetun kierron arviontiympäristö, joka matkii tuotantoympäristömme todellista työnkulkua.

Yhteispisteiden sijaan tuotamme neljä riippumatonta mittaria tuottaaksemme yksityiskohtaisen luonnehdinnan kustakin mallista:

Oikeellisuus
Läpäiseekö koodi piilotetut, kattavat toiminnalliset testit?
Laatu
Onko koodi ylläpidettävää ja tiukan talon tyylin samoin kuin muiden sovellettavien ohjeiden mukaista, kuten C++ Core Guidelines tai MISRA C?
Tehokkuus
Missä suoritusajassa ja millä token-määrällä ratkaisu löytyy?
Eheys (kriittinen)
Vastaako ilmoitettu tulos todellista tulosta? Tällä löydetään hallusinoivat mallit, jotka väittävät onnistuneensa vaikka tuottavat rikkinäistä koodia.

Varaa kartoitustapaaminen