2026 m. liepos mėnesį dėl IT infrastruktūros atnaujinimo darbų laikinai nebus atnaujinama dalis Valstybės duomenų agentūros skelbiamų duomenų rinkinių atvirų duomenų portale. Daugiau skaitykite https://data.gov.lt/blog/2026/07/03/2026-m-liepos-m%C4%97n-duomen%C5%B3-rinkini%C5%B3-atnaujinimo-tvarka/

Duomenų ištekliaus peržiūros: 255

LT-MLKM-modernBERT – tai maskuotosios kalbos (MLM) tipo lietuvių kalbos modelis, sukurtas nacionalinio projekto „Bendrojo lietuvių kalbos tekstyno ir vektorizuotų modelių sukūrimas“ imtyje. Modelis paremtas ModernBERT-base architektūra ir buvo apmokintas su „Bendrojo lietuvių kalbos tekstyno“ (3 etapo) duomenimis, kurį sudarė 1,87 mlrd. žodžių arba apie 49 mlrd. mokymo tokenų iš įvairių lietuviškų šaltinių (žiniasklaidos, dokumentų, mokslinių, viešojo sektoriaus ir kitų tekstų). Modelis prisideda prie projekto tikslo – sukurti aukštos kokybės lietuvių kalbos išteklius ir didžiuosius kalbos modelius, reikalingus DI, tyrimų ir skaitmeninėms inovacijoms. Modelis yra bazinis (angl. base) ir skirtas tolesniam pritaikymui (angl. fine-tuning) bei domenų adaptacijai viešojo ir privataus sektorių projektuose, kuriems reikalingas patikimas lietuvių kalbos apdorojimas. Modelis nėra daugiafunkcinis; konkrečioms užduotims būtinas papildomas pritaikymas atitinkamam tikslui. Jis naudoja ModernBertForMaskedLM Hugging Face diegimo biblioteką (v4.54.1) su bfloat16 tikslumu, kas užtikrina efektyvų mokinimą ir išvadų darymą (angl. inference). Modeliui apmokinti buvo naudojamas specialiai šiam projektui sukurtas lietuviškas tokenizatorius su 64 000 tokenų žodynu, optimizuotas lietuvių kalbos morfologijai ir žodžio dalių segmentavimui. 8 192 tokenų konteksto ilgis leidžia modeliui efektyviai apdoroti ilgus dokumentus, išlaikyti kalbinį tikslumą ir nuoseklumą.

Patinka 0
Brandos lygis -
Atnaujinama Neatnaujinamas
Kategorijos
Būsena Atvertas
Duomenų išteklius viešinamas Taip
Prieigos teisės Vieši
Licencija
Katalogas
Prieigos nuoroda https://huggingface.co/VSSA-SDSA/LT-MLKM-modernBE…
Laikotarpis 2024 m. gruodžio 3 d. - 2025 m. lapkričio 3 d.

Peržiūrėti papildomą informaciją +

Duomenų skelbėjas


Dalintis socialiniuose tinkluose

Prenumeruoja: 0

Duomenų pateiktys

Pavadinimas Dydis Formatas Publikuota Atnaujinta
Mažasis lietuvių kalbos vektorizuotas modelis - API 2025-10-31 Neatnaujinamas Atidaryti

Priskirtos organizacijos

Priskyrimo rūšis Organizacija
Duomenų rengėjas Valstybės skaitmeninių sprendimų agentūra

Komentarai

Komentuoti gali tik prisijungę naudotojai