Visi
< 24 GB
< 16 GB
< 8 GB

Maza izmēra atvērto svaru LLM novērtējums automatizēšanas uzdevumos latviešu valodā

Tīmeklī ir atrodami daudz dažādi lielo valodas modeļu (Large Language Model, LLM) novērtējumi, taču tie nesniedz pietiekamu atbildi uz mani interesējošo jautājumu – cik spējīgi ir lokāli izvietojamie maza izmēra atvērto svaru modeļi procesu automatizēšanas uzdevumos darbā ar tekstiem latviešu valodā? Nav runa par “čatošanu” vai automātisku programmatūras izstrādi, bet par lielos apjomos veicamu salīdzinoši nelielu teksta analīzes un apstrādes uzdevumu veikšanu kā rutīnu un jautājumu – ar cik mazu modeli mēs to varam panākt.

Zemāk redzamā tabula apkopo šādu LLM novērtējumus dažādos automatizēšanas etalonuzdevumos, kuri kopumā var palīdzēt izprast šo modeļu pielietojamību praksē. Modeļi un to kvantējumi ir izvēlēti tā, lai tiem pietiktu vietas 24 GB grafiskajā kartē (izņemot divus – ziņkārības dēļ). Visiem modeļiem, kuriem ir iebūvēts “spriešanas” tekstvienību ģenerēšanas mehānisms (thinking/reasoning), tas tika atslēgts, lai lieki netērētu laiku un enerģiju šādos uzdevumos, kur šis mehānisms nav nepieciešams. Atsevišķi testi ar ieslēgtu “spriešanu” parādīja, ka rezultāti visbiežāk praktiski nemainās, tikai atsevišķos gadījumos uzlabojoties par pāris procentpunktiem, taču vienlaicīgi stipri palēninot visu procesu. Visiem modeļiem temperatūra tika iestatīta vienāda ar 0. Modeļu servēšanai tika izmantota ollama.

Tabulas pēdējās rindās salīdzinājumam ir doti trīs aizvērto svaru GPT-5.4 modeļu rezultāti (no kuriem pirmo divu rindu rezultāti faktiski ir negodīgi, jo runa ir par nesalīdzināmi lielākiem modeļiem nekā visi pārējie tabulā iekļautie), kā arī divi atbalsta vektoru mašīnas (Support Vector Machine, SVM) rezultāti klasificēšanas uzdevumiem. Zem tabulas ir paskaidrots, kā SVM rezultāti bija iegūti.

Zem tabulas ir dots visu etalonuzdevumu būtības skaidrojums.

Modelis q4 GB Vienkāršs RAG Īsa teksta klasificēšana Kontroldarba atbilžu vērtēšana Birku izvēle ziņu rakstiem Nosaukto entitāšu atpazīšana Pieturzīmju salikšana teikumos Vārdu nozīmes izpratne Rokraksta atpazīšana

Vienkāršs RAG

Dati: 905 ziņu raksti, kas nejauši atlasīti no 3677 rakstiem, kuri bija ievākti 2024.-2025. gadā no ziņu portāla “ritakafija.lv”. Raksti tika padoti uz GPT-5.4 kopā ar pieprasījumu no raksta teksta izvēlēties vienu netriviālu faktu un noformulēt jautājumu, uz kuru atbilde būtu izvēlētais fakts, kā arī uzrakstīt pareizo atbildi. Pie katra no šiem rakstiem tika piesaistīti vēl pieci citi raksti, kas uz attiecīgo jautājumu atbildi nesniedz, taču to tematika ir līdzīga. Šādi dati simulē vienkāršu izguves paplašinātu ģenerēšanu (Retrieval-Augmented Generation, RAG), kad lietotājs ir uzdevis jautājumu, meklēšanas sistēma ir atradusi sešus avotus-kandidātus un LLM uzdevums ir noformulēt labu atbildi. Vidējais vienas uzvednes teksta apjoms ir aptuveni 10 000 tekstvienību.
Uzdevums: Izmantojot dotos sešus rakstus, sniegt pareizu atbildi uz doto jautājumu.
Mērs: Uzģenerētās atbildes, komplektā ar uzdoto jautājumu un pareizo atbildi, tika padotas uz GPT-5.4-mini, kura uzdevums ir noteikt, vai sniegtā atbilde ir uzskatāma par pareizu. Galarezultāts ir pareizo atbilžu skaits procentos.

Īsa teksta klasificēšana

Mērs: Vidējais novērtējums no diviem zemāk aprakstītajiem 2 klašu un 3 klašu klasificēšanas uzdevumiem – klikšķēsmas klasificēšana un noskaņojuma klasificēšana.

Klikšķēsmas klasificēšana

Dati: No dažādiem Latvijas ziņu portāliem tika ievākti 5000 ziņu virsraksti, kas tika cilvēka marķēti divās klasēs – ir klikšķēsma (pozitīvā klase), nav klikšķēsma (negatīvā klase). Pozitīvajā klasē sakrājās 1206 piemēri. Līdz ar to negatīvajā klasē tika nejauši atlasīts tas pats piemēru skaits. Kopā – 2412 piemēri. Testa kopa modeļu novērtēšanai satur nejauši izvēlētus 1206 piemērus (603 pozitīvi, 603 negatīvi).
Uzdevums: Binārā klasificēšana. Uzvedne bez piemēriem (“zero-shot”). Modelim uzvednē ir dota klikšķēsmas definīcija: Clickbait is designed to attract attention and to entice users to follow a link and view the linked piece of online content, being typically deceptive, sensationalized, or otherwise misleading. It aims to exploit the “curiosity gap”, providing just enough information to make readers of news websites curious, but not enough to satisfy their curiosity without clicking through to the linked content.
Mērs: Pozitīvās klases F1.
SVM: Lineārais SVM apmācīts ar 1206 apmācības piemēriem (603 pozitīvi, 603 negatīvi), kas nav iekļauti augstāk minētajā testa kopā. Teksts vektorizēts ar TF-IDF vai multilingual-e5-large.

Noskaņojuma klasificēšana

Dati: No Twitter ievākts 1177 tvītu korpuss (Peisenieks & Skadiņš, 2014), kas ir cilvēku marķēts trīs klasēs - negatīvs noskaņojums (167 tvīti), neitrāls noskaņojums (627 tvīti) un pozitīvs noskaņojums (383 tvīti).
Uzdevums: Trīs klašu klasificēšana. Uzvedne bez piemēriem (“zero-shot”). Bija izmēģināta arī sešu piemēru (six-shot) uzvedne ar diviem piemēriem katrai klasei, taču šāda uzvedne lielākajai daļai modeļu pasliktināja rezultātu.
Mērs: Makro F1.
SVM: Lineārais SVM apmācīts ar 3569 apmācības piemēriem, kas iegūti no (Vīksna, 2018) datu kopas (513 negatīvi, 2169 neitrāli, 887 pozitīvi). Teksts vektorizēts ar TF-IDF vai multilingual-e5-large.

Kontroldarba atbilžu vērtēšana

Dati: No SciEntsBank (Dzikovska et al., 2013) iegūta datu kopa ar 1273 kortežiem, kur katrs satur kontroldarba jautājumu, pareizo atbildi un studenta atbildi. 534 gadījumos studenta atbilde ir pareiza, bet 739 gadījumos – nepareiza. Visi teksti ir ļoti īsi. Visi teksti tika iztulkoti uz latviešu valodu ar GPT-5.4.
Uzdevums: Ņemot vērā doto jautājumu, pareizo atbildi un studenta atbildi, novērtēt, vai studenta atbilde atbilst pareizajai atbildei (atbilst/neatbilst). Uzvedne bez piemēriem (“zero-shot”). Uzdevums veids pieder pie automatizētas īsu atbilžu vērtēšanas (Automated Short-Answer Grading).
Mērs: Makro F1.

Birku izvēle ziņu rakstiem

Dati: 1229 ziņu raksti, kas nejauši atlasīti no 3677 rakstiem, kuri bija ievākti 2024.-2025. gadā no ziņu portāla “ritakafija.lv”. Katram rakstam jau ir piesaistīta viena vai vairākas no kopumā 15 iespējamām birkām (iekavās norādīts rakstu skaits ar attiecīgo birku): sabiedrība (488), kriminālziņas (156), pasaulē (165), politika (191), ekonomika (80), finanses (105), virtuve (91), ezotērika (142), vaļasprieki (148), kultūra & izklaide (148), teātris & kino (85), laika ziņas (145), attiecības (157), skaistums & veselība (102), mājoklis & dārzs (69). Jāsaka gan, ka birku piesaiste nav veikta pilnīgi konsekventi un ir pielaistas dažādas kļūdas, līdz ar to augsti rezultāti šeit nav gaidāmi, taču modeļu salīdzināšanai datu kopa ir noderīga.
Uzdevums: Katram rakstam jāizvēlas piemērotākās birkas neierobežotā skaitā. Uzvedne bez piemēriem (“zero-shot”). Uzvednē dots katras birkas skaidrojums.
Mērs: Vidējais no pozitīvo klašu F1, katras birkas izvēli uzskatot par binārās klasificēšanas uzdevumu.
SVM: Lineārais SVM apmācīts ar 2448 ziņu rakstiem, kas nav iekļauti testa kopā. Klašu sadalījums: sabiedrība (964), kriminālziņas (291), pasaulē (348), politika (406), ekonomika (204), finanses (243), virtuve (155), ezotērika (281), vaļasprieki (280), kultūra & izklaide (353), teātris & kino (181), laika ziņas (302), attiecības (274), skaistums & veselība (198), mājoklis & dārzs (151). Teksts vektorizēts ar TF-IDF vai multilingual-e5-large.

Nosaukto entitāšu atpazīšana

Dati: No TildeNER repozitorija iegūti dati, kas satur 2233 teikumus ar atzīmētām 3654 entitātēm. Veikti nelieli kļūdu labojumi. Seši entitāšu veidi: PER (persona), ORG (organizācija), LOC (atrašanās vieta, ieskaitot valstis u. tml.), TIM (laiks), PRO (produkts), MON (nauda).
Uzdevums: Teikumā atpazīt visas doto veidu entitātes. Uzvednē visi entitāšu veidi paskaidroti, iekļauti četri nelieli piemēri.
Mērs: Makro F1. Ja atbilde ir nepareizi stukturēta, tā tiek uzskatīta par nepareizu.

Pieturzīmju salikšana teikumos

Dati: 2148 teikumi no Universal Dependencies 2.18 Latvian LVTB, atmetot teikumus ar dialoga veida tiešo runu.
Uzdevums: Salikt pareizas pieturzīmes teikumā, no kura tās visas ir izņemtas. Uzvedne bez piemēriem (“zero-shot”).
Mērs: Salikto pieturzīmju (kā konkrētajā pozīcijā pievienoto tekstvienību) esamības salīdzināšana ar oriģinālajā teikumā esošajām pieturzīmēm. No tā tiek aprēķināta F1 vērtība, papildus pieņemot, ka jebkura vārda modifikācija ir aplami pozitīvs gadījums. Vērā ņemtās pieturzīmes: punkts, komats, semikols, kols un domu zīme. Teikuma beigu pieturzīme netiek ņemta vērā.

Vārdu nozīmes izpratne

Dati: No latviešu valodas vārdnīcas nejauši izvēlēti 1000 vārdi.
Uzdevums: Uzrakstīt 1-3 teikumus garu dotā vārda nozīmes skaidrojumu latviešu valodā, nepieminot šo vārdu, tā tulkojumu vai tā citas morfoloģiskās formas, tādā veidā, lai skaidrojuma lasītājam būtu skaidrs, par kuru tieši vārdu ir runa.
Mērs: Uzģenerētie vārdu nozīmes skaidrojumi tiek padoti uz GPT-5.4 un tiek aprēķināts, cik procentos gadījumu no viena paša skaidrojuma izdodas atpazīt oriģinālo vārdu. Faktiski tiek izmērītas skaidrojumu rakstošā modeļa zināšanas par vārdu nozīmi un spējas šo nozīmi izklāstīt pietiekami sakarīgi, kas norāda uz valodas prasmi.

Rokraksta atpazīšana

Dati: No garamantas.lv iegūti attēli, kuros redzams skenēts rokrakstā rakstīts teksts latviešu valodā. Kopā - 100 attēli, 9399 vārdi.
Uzdevums: Veikt rokraksta atpazīšanu, izgūstot visu attēlā redzamo tekstu.
Mērs: 1 - WER, kur WER ir vārdu kļūdu intensitāte (Word Error Rate).