2026 m. liepos mėnesį dėl IT infrastruktūros atnaujinimo darbų laikinai nebus atnaujinama dalis Valstybės duomenų agentūros skelbiamų duomenų rinkinių atvirų duomenų portale. Daugiau skaitykite https://data.gov.lt/blog/2026/07/03/2026-m-liepos-m%C4%97n-duomen%C5%B3-rinkini%C5%B3-atnaujinimo-tvarka/

Rasta duomenų išteklių: 1
Publikuota: 2025-10-31 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LT-MLKM-modernBERT – tai maskuotosios kalbos (MLM) tipo lietuvių kalbos modelis, sukurtas nacionalinio projekto „Bendrojo lietuvių kalbos tekstyno ir vektorizuotų modelių sukūrimas“ imtyje. Modelis paremtas ModernBERT-base architektūra ir buvo apmokintas su „Bendrojo lietuvių kalbos tekstyno“ (3 etapo) duomenimis, kurį sudarė 1,87 mlrd. žodžių arba apie 49 mlrd. mokymo tokenų iš įvairių lietuviškų šaltinių (žiniasklaidos, dokumentų, mokslinių, viešojo sektoriaus ir kitų tekstų). Modelis prisideda prie projekto tikslo – sukurti aukštos kokybės lietuvių kalbos išteklius ir didžiuosius kalbos modelius, reikalingus DI, tyrimų ir skaitmeninėms inovacijoms. Modelis yra bazinis (angl. base) ir skirtas tolesniam pritaikymui (angl. fine-tuning) bei domenų adaptacijai viešojo ir privataus sektorių projektuose, kuriems reikalingas patikimas lietuvių kalbos apdorojimas. Modelis nėra daugiafunkcinis; konkrečioms užduotims būtinas papildomas pritaikymas atitinkamam tikslui. Jis naudoja ModernBertForMaskedLM Hugging Face diegimo biblioteką (v4.54.1) su bfloat16 tikslumu, kas užtikrina efektyvų mokinimą ir išvadų darymą (angl. inference). Modeliui apmokinti buvo naudojamas specialiai šiam projektui sukurtas lietuviškas tokenizatorius su 64 000 tokenų žodynu, optimizuotas lietuvių kalbos morfologijai ir žodžio dalių segmentavimui. 8 192 tokenų konteksto ilgis leidžia modeliui efektyviai apdoroti ilgus dokumentus, išlaikyti kalbinį tikslumą ir nuoseklumą.

API
255
0
0