So vaši podatki pripravljeni za fino uglaševanje?
Največkrat nas vprašate, koliko primerov je treba. Kratek odgovor: petdeset resničnih primerov s preverjenimi odgovori zadošča, da izmerimo, ali se učenje splača, pri ozki nalogi s strogo obliko pa tudi za prvi poskusni model. Ali učenje sploh potrebujete, je odvisno od naloge. To iz vaših odgovorov oceni spodnje preverjanje.
Dvanajst vprašanj, približno tri minute
Rezultat pove RAG, SFT, CPT + SFT ali še ne, z utemeljitvijo, koliko dela bo s pripravo podatkov in kateri je naslednji korak s ceno. Odgovori ostanejo v vašem brskalniku. Brez piškotkov.
Rezultat je okviren. Sledi istim vprašanjem, ki jih postavimo na prvem klicu; izmerjen odgovor da evalvacija na vaših primerih.
Koliko primerov potrebujete?
Za začetek manj, kot večina pričakuje, za konec več, kot večina pričakuje. Vedno začnemo s petdesetimi resničnimi primeri naloge z odgovori, ki jih je preveril nekdo, ki to delo opravlja. Zamrznemo jih kot testni nabor, na katerem se nihče ne uči. Na njem najprej izmerimo neuglašene modele. Če kateri od njih nalogo že opravi, učenja ne potrebujete, in to ste izvedeli za ceno enega dneva.
Pri ozki nalogi s strogo obliko, na primer šest polj z računa ali razvrščanje zahtevkov v vaše kategorije, je petdeset primerov dovolj tudi za prvi poskusni model. Tako deluje naš enotedenski poskus. Širše naloge, prosti odgovori ali nov jezik potrebujejo več. Koliko več, pokaže meritev na vaših petdesetih, ne pravilo na pamet.
Zgornjo mejo postavi kakovost, ne količina. Za naš slovenski medicinski raziskovalni model smo najprej zgradili 140.063 učnih zapisov in vsakega spustili skozi kontrolo kakovosti, preden se je učenje sploh začelo. Tisoč primerov z nepreverjenimi odgovori model nauči vaših napak.
PDF-ji so izvorno gradivo, ne učni podatki
»Ali lahko model preprosto uglasimo na naših PDF-jih?« je drugo najpogostejše vprašanje. Neposredno ne. Model se uči iz parov: ta vhod, ta odgovor. PDF ni ne eno ne drugo. Imate dve možnosti:
- Iskanje (RAG): PDF-je indeksiramo, ustrezni odstavki gredo v poziv. Primerno, ko je odgovor dejstvo iz dokumenta.
- Učenje: besedilo izluščimo (pri skenih OCR, pri tabelah postavitev strani) in iz njega sestavimo pare, na primer dokument in JSON, ki ga mora vrniti. Primerno, ko se mora model naučiti obliko ali način dela.
Zahtevki in e-pošta so bližje učnim podatkom: sporočilo stranke in odgovor vaše službe sta že par. Še vedno jih je treba očistiti, odstraniti osebne podatke in preveriti, ali so bili odgovori dobri.
Štirje možni rezultati
- RAG. Vsebina, ki se spreminja vsak teden, odgovori, ki potrebujejo vir, dostop, ki je različen po dokumentih. Učenje tu ne pomaga. Celotna primerjava je v zapisu Fino uglaševanje ali RAG.
- SFT. Vedenje: stroga oblika izhoda, vaša terminologija, manjši jezik, klici orodij. Pri našem javnem uglaševanju klicanja orodij se je delež pravilnih odločitev »brez klica« na 2.471 ločenih korakih dvignil z 0,847 na 0,925. Tega iskanje ne da.
- CPT + SFT. Jezik ali stroka je splošnim modelom tuja, vi pa imate velik arhiv besedil. Model najprej prebere arhiv (nadaljevano predučenje), nato se nauči naloge. Po nadaljevanem predučenju na 1,78 milijarde slovenskih žetonov je perpleksnost našega modela 4B padla za 51 %. To je delo v obsegu programa.
- Še ne. Ni primerov s pravilnimi odgovori. Ne učenje ne poštena primerjava nista mogoča. Najprej jih zberite petdeset.
Opisi modelov in rezultati za zgornje številke so javni na Hugging Face.
Kdaj nas ne potrebujete
- Velikemu API-ju pošljete nekaj sto zahtevkov na mesec, odgovori so dobri in podatki smejo iz podjetja. Ostanite pri API-ju. Kalkulator na ceniku pokaže, kdaj se lasten model začne splačati.
- V podjetju nihče ne zna povedati, kaj je pravilen odgovor. Potem modela tudi nihče ne more preveriti, ne našega ne kogarkoli drugega.
- Potrebujete jamstvo za klinično ali pravno odločitev. Uglašen model ga ne da. Lahko pripravi osnutek za človeka, ki odloči.
Koliko stane naslednji korak
Če preverjanje pravi »še ne«, je naslednji korak brezplačen: zberite petdeset primerov. Sicer je eden od dveh:
- Evalvacija, 1.900 €, en dan. Do pet modelov na zamrznjenem naboru iz vaših primerov, tabela rezultatov in zapisano priporočilo, ali učiti in kaj. Znesek se odšteje od pilota. Primer poročila.
- Pilot S, 3.900 €, 2–3 tedne. Ko preverjene primere in testni nabor že imate: en fino uglašen model, lestvica osnova proti uglašenemu, gradnja GGUF in priporočilo naprej / ne naprej.
Če moramo podatke zgraditi mi, je to Pilot M (12.000 €, 4–5 tednov). Programi z nadaljevanim predučenjem so od 20.000 €. Vse cene v EUR brez DDV, na ceniku.
Pogosta vprašanja
Koliko primerov potrebujem za fino uglaševanje modela na podatkih podjetja?
Za meritev, ali se učenje splača: petdeset resničnih primerov s preverjenimi odgovori, zamrznjenih kot testni nabor. Pri ozki nalogi s strogo obliko je to dovolj tudi za prvi poskusni model. Širše naloge potrebujejo več, koliko približno, pa pokaže evalvacija na vaših petdesetih primerih.
Ali lahko model fino uglasim neposredno na PDF-jih?
Ne neposredno. PDF-ji so izvorno gradivo: za dejstva iz njih uporabite iskanje (RAG), za učenje pa je treba besedilo izluščiti (pri skenih z OCR) in iz njega sestaviti pare vhod–izhod, na primer dokument in polja, ki jih mora vrniti.
Koliko stane fino uglaševanje jezikovnega modela na podatkih podjetja?
Pri MediaAtlasu stane enodnevna evalvacija na vaših dokumentih 1.900 € in se odšteje od pilota. Pilot S na podatkih, ki jih že imate, stane fiksno 3.900 € (2–3 tedne), Pilot M, kjer podatke zgradimo mi, 12.000 € (4–5 tednov), program pa od 20.000 €. Cene brez DDV.
Kdaj zadošča RAG in fino uglaševanje ni potrebno?
Ko se vsebina pogosto spreminja, mora odgovor navesti vir ali je dostop omejen po dokumentih, model pa že odgovarja v pravi obliki. Takrat je dobro iskanje preprostejša pot.
Ali se moji odgovori kje shranijo ali pošljejo?
Ne. Preverjanje teče v celoti v vašem brskalniku, brez piškotkov. Nič se ne shrani in nič se ne pošlje.
Petdeset primerov, en izmerjen odgovor.
Pošljite petdeset resničnih primerov naloge. V enem dnevu veste, ali se učenje splača, kateri model in kaj bi dodalo iskanje.