Primer poročila · enodnevna evalvacija

Preden učite, izmerite.

To dobite po enodnevni evalvaciji (1.900 €, upoštevano pri pilotu): nalogo, zamrznjen testni nabor, rezultate, kaj gre narobe, in pisno priporočilo.

Sestavljeno iz našega javnega dela (Sraka 27B), ne iz dela za naročnika. Poročilo za naročnika ima enake razdelke, na vaši nalogi in vaših podatkih. Vse številke so v opisu modela.

Nalogaslovenski asistent, ki odgovarja in kliče orodja
Testna nabora3.500 + 2.471 primerov, zamrznjena
Primerjavaneuglašen odprt model 27B proti uglašenemu
Časen delovni dan

Naloga in kaj pomeni "dobro"

Asistent, ki odgovarja v tekoči, pravilni slovenščini in sredi pogovora odloči, ali naj pokliče orodje, katero in s katerimi argumenti. Kaj je "dobro", smo zapisali, preden smo pognali kateri koli model:

  • Znanje in sklepanje v slovenščini: delež pravilnih odgovorov na sedmih slovenskih nalogah.
  • Raba orodij: štiri ločene ocene, ker se pokvarijo različno: ali sploh klicati, pravo orodje, pravi argumenti in molk, ko orodje ni potrebno.

Pri evalvaciji za naročnika ta korak uporabi petdeset vaših resničnih primerov in ljudi, ki delo poznajo. Opredelitev "dobrega" je zapisana in potrjena pred merjenjem, zato rezultata kasneje ni mogoče prerekati.

Zamrznjena testna nabora

  • Slovenian-LLM-Eval (cjvt/slovenian-llm-eval): 500 primerov na nalogo, 7 nalog, skupaj 3.500, brez primerov v pozivu, ista koda za vsak model.
  • Naslednji korak s klicem orodja: 2.471 zadržanih korakov pogovora, ki jih model pri učenju ni videl.

Zamrznjen pomeni, da ima nabor različico in se nikoli ne spremeni. Vsak kasnejši model, ponovno učenje ali posodobitev se oceni na istih primerih, tako se poslabšanje ujame, preden pride do uporabnikov.

Rezultati: znanje in sklepanje v slovenščini

NalogaNeuglašena osnovaUglašenΔ
arc_easy0,9680,982+0,014
arc_challenge0,9420,950+0,008
hellaswag0,6860,752+0,066
piqa0,8520,862+0,010
openbookqa0,8760,920+0,044
winogrande0,7080,748+0,040
boolq0,8780,886+0,008
Povprečje0,8440,871+0,027

Evalvacija sama da prvi stolpec. Drugi pokaže, kaj je kasneje spremenilo učenje, da na eni strani vidite obe polovici cikla.

Rezultati: raba orodij

OcenaNeuglašena osnovaUglašenΔ
Pravilno odloči, ali poklicati orodje0,8930,922+0,029
Izbere pravo orodje0,7920,801+0,009
Izpolni prave argumente0,6280,651+0,023
Ne kliče, ko orodje ni potrebno0,8470,956+0,109

Največji napredek je najmanj viden: vedeti, kdaj orodja ne klicati. Neuglašen model pokliče orodje v približno vsakem sedmem primeru, ko bi moral samo odgovoriti. V praksi to pomeni odvečne klice, v sistemu z odobritvami pa človeka, ki odobrava stvari, ki jih nihče ni zahteval.

Kaj gre narobe, s primeri

Ocene skrijejo vrsto napake, zato vsako poročilo našteje napake, ki štejejo, razvrščene po vzroku:

Vrzel v znanju · ostane tudi po učenjuNa vprašanje, kdo je napisal Cvetje v jeseni, model odgovori Oton Župančič. Napisal ga je Ivan Tavčar.
Vrzel v znanju · odpravljena z nadaljevanim predučenjemPrejšnja različica si je izmislila višino Triglava in navajala neobstoječe "največje slovenske pesnike". Po nadaljevanem predučenju na slovenskem besedilu odgovori 2.864 m ter navede Prešerna, Kosovela in Župančiča.
Kompromis · zavestna izbiraZmanjšanje deleža podatkov za klicanje orodij s 96 % na 63 % je stalo približno 1,9 točke pri izbiri pravega orodja in prineslo 2,9 točke v slovenščini. Poročilo take kompromise zapiše, da izberete sami.

Ta del odloči, kaj narediti naprej: vrzeli v znanju zahtevajo besedilo ali ciljne podatke, napake v obliki več primerov, nekaterih napak pa se ne splača popravljati.

Priporočilo

  • Učiti: da, za rabo orodij. Vrzel pri "ne kliče, ko orodje ni potrebno" je velika in se z učenjem zapre.
  • Slovenščina: nadaljevano predučenje, ne daljše uglaševanje. Drugi prehod čez iste podatke za uglaševanje ni prinesel ničesar: ocene orodij so se premaknile za manj kot točko, slovenščina je rahlo padla. Ocene znanja je premaknilo slovensko besedilo.
  • Dejstva še naprej preverjajte. Napake v znanju ostanejo. Pri odgovorih, ki morajo biti natančni, model povežite z iskanjem po vaših dokumentih.
  • Namestitev lokalno kot GGUF na eni delovni postaji za manjšo ekipo; iste uteži prek vLLM služijo celemu oddelku.
Naslednji korak: pilot s fiksno ceno. Pilot S (3.900 €, 2–3 tedne), ko podatki obstajajo; Pilot M (12.000 €, 4–5 tednov), ko jih je treba zgraditi. Evalvacija se upošteva pri ceni.

Kaj doda poročilo za naročnika

  • Vaših petdeset primerov in vašo opredelitev "dobrega", potrjeno pred merjenjem.
  • Isti testni nabor, ocenjen na več kandidatih, tudi na velikem modelu prek API-ja, da vidite, kaj mora učenje preseči.
  • Primerjavo stroškov: plačila za API pri vašem obsegu proti lastnemu modelu.
  • Kje so ostali podatki: vaši primeri so anonimizirani in se ne uporabijo za nič drugega.

Želite to na svoji nalogi? En dan, fiksna cena, upoštevano pri pilotu.