Naloga in kaj pomeni "dobro"
Asistent, ki odgovarja v tekoči, pravilni slovenščini in sredi pogovora odloči, ali naj pokliče orodje, katero in s katerimi argumenti. Kaj je "dobro", smo zapisali, preden smo pognali kateri koli model:
- Znanje in sklepanje v slovenščini: delež pravilnih odgovorov na sedmih slovenskih nalogah.
- Raba orodij: štiri ločene ocene, ker se pokvarijo različno: ali sploh klicati, pravo orodje, pravi argumenti in molk, ko orodje ni potrebno.
Pri evalvaciji za naročnika ta korak uporabi petdeset vaših resničnih primerov in ljudi, ki delo poznajo. Opredelitev "dobrega" je zapisana in potrjena pred merjenjem, zato rezultata kasneje ni mogoče prerekati.
Zamrznjena testna nabora
- Slovenian-LLM-Eval (
cjvt/slovenian-llm-eval): 500 primerov na nalogo, 7 nalog, skupaj 3.500, brez primerov v pozivu, ista koda za vsak model. - Naslednji korak s klicem orodja: 2.471 zadržanih korakov pogovora, ki jih model pri učenju ni videl.
Zamrznjen pomeni, da ima nabor različico in se nikoli ne spremeni. Vsak kasnejši model, ponovno učenje ali posodobitev se oceni na istih primerih, tako se poslabšanje ujame, preden pride do uporabnikov.
Rezultati: znanje in sklepanje v slovenščini
| Naloga | Neuglašena osnova | Uglašen | Δ |
|---|---|---|---|
| arc_easy | 0,968 | 0,982 | +0,014 |
| arc_challenge | 0,942 | 0,950 | +0,008 |
| hellaswag | 0,686 | 0,752 | +0,066 |
| piqa | 0,852 | 0,862 | +0,010 |
| openbookqa | 0,876 | 0,920 | +0,044 |
| winogrande | 0,708 | 0,748 | +0,040 |
| boolq | 0,878 | 0,886 | +0,008 |
| Povprečje | 0,844 | 0,871 | +0,027 |
Evalvacija sama da prvi stolpec. Drugi pokaže, kaj je kasneje spremenilo učenje, da na eni strani vidite obe polovici cikla.
Rezultati: raba orodij
| Ocena | Neuglašena osnova | Uglašen | Δ |
|---|---|---|---|
| Pravilno odloči, ali poklicati orodje | 0,893 | 0,922 | +0,029 |
| Izbere pravo orodje | 0,792 | 0,801 | +0,009 |
| Izpolni prave argumente | 0,628 | 0,651 | +0,023 |
| Ne kliče, ko orodje ni potrebno | 0,847 | 0,956 | +0,109 |
Največji napredek je najmanj viden: vedeti, kdaj orodja ne klicati. Neuglašen model pokliče orodje v približno vsakem sedmem primeru, ko bi moral samo odgovoriti. V praksi to pomeni odvečne klice, v sistemu z odobritvami pa človeka, ki odobrava stvari, ki jih nihče ni zahteval.
Kaj gre narobe, s primeri
Ocene skrijejo vrsto napake, zato vsako poročilo našteje napake, ki štejejo, razvrščene po vzroku:
Ta del odloči, kaj narediti naprej: vrzeli v znanju zahtevajo besedilo ali ciljne podatke, napake v obliki več primerov, nekaterih napak pa se ne splača popravljati.
Priporočilo
- Učiti: da, za rabo orodij. Vrzel pri "ne kliče, ko orodje ni potrebno" je velika in se z učenjem zapre.
- Slovenščina: nadaljevano predučenje, ne daljše uglaševanje. Drugi prehod čez iste podatke za uglaševanje ni prinesel ničesar: ocene orodij so se premaknile za manj kot točko, slovenščina je rahlo padla. Ocene znanja je premaknilo slovensko besedilo.
- Dejstva še naprej preverjajte. Napake v znanju ostanejo. Pri odgovorih, ki morajo biti natančni, model povežite z iskanjem po vaših dokumentih.
- Namestitev lokalno kot GGUF na eni delovni postaji za manjšo ekipo; iste uteži prek vLLM služijo celemu oddelku.
Kaj doda poročilo za naročnika
- Vaših petdeset primerov in vašo opredelitev "dobrega", potrjeno pred merjenjem.
- Isti testni nabor, ocenjen na več kandidatih, tudi na velikem modelu prek API-ja, da vidite, kaj mora učenje preseči.
- Primerjavo stroškov: plačila za API pri vašem obsegu proti lastnemu modelu.
- Kje so ostali podatki: vaši primeri so anonimizirani in se ne uporabijo za nič drugega.