Jatkuvuus
Seuraa tekoälyn kustannustehokkuutta ja vältä myyjälukko
Määrällinen tutkimus auttaa pitämään tekoälykustannukset kurissa.
Varo tekoälyn myyjälukkoa
Tekoälyn suosio on voimakkaasti kasvanut viime vuosina. Kehittyvässä markkinatilanteessa suuret toimijat myyvät palvelua tappiolla kasvattaakseen markkinaosuuttaan ja karkottaakseen kilpailijat. Asiakkaat saattavat tulla riippuvaisiksi yhdestä toimittajasta, joka määräävään markkina-asemaan päästyään voi sanella hintansa.
Myyjälukon lisäksi voi laueta sääntelyriski, joka estää joidenkin kielimallien toimituksen joillekin markkina-alueille.
Valitse järkevä, tehokas mittari
Generatiivisen tekoälyn käytön tavanomainen yksikkö on token eli pieni määrä tietoa, kuten sanoja, sanan osia, merkkejä tai kuvapistejoukkoja, joita tekoälymalli käsittelee sekä koulutuksen että päättelyn aikana.
Olisiko token-hinta järkevä mittari? Ehkä jollekin tietylle algoritmille ja syötetyypille. Se on karkeasti verrattavissa perinteisen infrastruktuuripalvelun laskutukseen, jossa maksetaan suoritetuista konekielikäskyistä tai suoritintunneista.
Infrastruktuuripalveluntarjoaja voisi laskuttaa uudemman sukupolven keskusyksiköstä 30% enemmän suoritintunnilta. Jos sovelluksesi toimii 20% nopeammin uudessa ympäristössä, vaihto maksaisi noin 8% enemmän (1.20/1.30≈0.92). Lisähinnalla saisi hieman nopeamman vasteajan ja lisää kasvunvaraa ja siten paremman käyttökokemuksen. Jos sovelluksen optimointi hyödyntämään uuden alustan käskylaajennuksia toisi 50% lisää suorituskykyä, kustannustehokkuus paranisi 15% (1.50/1.30≈1.15).
Se, montako suorittimen kellojaksoa tehtävän suorittamiseen kuluu, riippuu suuresti rinnakkaisuuden asteesta (vektorikäskyistä tai monisäikeisyydestä) sekä muistiviittausten hajonnasta suoritusaikana. Vastaavasti se, mitä jollakin token-määrällä voidaan saada aikaan, riippuu käytetystä tekoälymallista, käytettävissä olevasta muistitilasta sekä tarvittavan asiayhteyden laajuudesta.
Siksi on mielekästä mitata kustannustehokkuutta todellisissa käyttötilanteissa eikä valita mallia, joka näyttää parhaalta jossakin vertailussa, joka mahdollisesti tehtiin jonkin toimittajan toimeksiannosta.
Suhtaudu varauksella julkisiin vertailuihin
Ulkoisiin tulostaulukoihin luottaminen vaarantaa toimintasi kolmella tavalla:
- Väärä suorituskykyarvio
- Julkiset tulokset mitataan toimittajan laiteympäristössä, joka voi laskea tarkemmin kuin paikallinen tuotantoympäristösi; haluathan pitää tietosi suojattuina. Kvantisointikohinattomassa pilviympäristössä erinomaisesti toimiva malli voi toimia paljon huonommin muualla.
- Tietojen saastuminen
- Jos suositut suorituskykyvertailut päätyvät uusien mallien
koulutusaineistoon, ne mittaavat muistamista eivätkä päättelyä.
Malleille on annettava
uusia
tehtäviä, joita ne näkevät ensi kertaa. - Kerralla oikein -virhepäätelmä
- Monissa vertailuissa tutkitaan, kuinka hyvää ohjelmakoodia malli saa aikaan yhdellä yrityksellä. Ohjelmistotekniikka etenee kuitenkin askeleittain (kirjoita → käännä → testaa → korjaa). On mitattava mallin kykyä korjata toimintaansa kääntäjän ilmoitusten perusteella.
Siirry toimittajan väittämästä
kyvystä todennettuun tuotantoon
Olemme kehittämässä eristettyä kielimallien arviontiympäristöä. Ratkaisevaa on eheyspisteiden vähentäminen malleilta, jotka tuottavat vakuuttavia mutta vääriä vastauksia — anteeksiantamaton vikatila automaattisessa infrastruktuurin hallinnassa.
Meillä on suljetun kierron arviontiympäristö, joka matkii tuotantoympäristömme todellista työnkulkua.
Yhteispisteiden
sijaan tuotamme neljä riippumatonta mittaria
tuottaaksemme yksityiskohtaisen luonnehdinnan kustakin mallista:
- Oikeellisuus
- Läpäiseekö koodi piilotetut, kattavat toiminnalliset testit?
- Laatu
- Onko koodi ylläpidettävää ja tiukan
talon tyylin
samoin kuin muiden sovellettavien ohjeiden mukaista, kuten C++ Core Guidelines tai MISRA C? - Tehokkuus
- Missä suoritusajassa ja millä token-määrällä ratkaisu löytyy?
- Eheys (kriittinen)
- Vastaako ilmoitettu tulos todellista tulosta? Tällä löydetään
hallusinoivat
mallit, jotka väittävät onnistuneensa vaikka tuottavat rikkinäistä koodia.