Duomenų ištekliaus peržiūros: 255
LT-MLKM-modernBERT – tai maskuotosios kalbos (MLM) tipo lietuvių kalbos modelis, sukurtas nacionalinio projekto „Bendrojo lietuvių kalbos tekstyno ir vektorizuotų modelių sukūrimas“ imtyje. Modelis paremtas ModernBERT-base architektūra ir buvo apmokintas su „Bendrojo lietuvių kalbos tekstyno“ (3 etapo) duomenimis, kurį sudarė 1,87 mlrd. žodžių arba apie 49 mlrd. mokymo tokenų iš įvairių lietuviškų šaltinių (žiniasklaidos, dokumentų, mokslinių, viešojo sektoriaus ir kitų tekstų). Modelis prisideda prie projekto tikslo – sukurti aukštos kokybės lietuvių kalbos išteklius ir didžiuosius kalbos modelius, reikalingus DI, tyrimų ir skaitmeninėms inovacijoms. Modelis yra bazinis (angl. base) ir skirtas tolesniam pritaikymui (angl. fine-tuning) bei domenų adaptacijai viešojo ir privataus sektorių projektuose, kuriems reikalingas patikimas lietuvių kalbos apdorojimas. Modelis nėra daugiafunkcinis; konkrečioms užduotims būtinas papildomas pritaikymas atitinkamam tikslui. Jis naudoja ModernBertForMaskedLM Hugging Face diegimo biblioteką (v4.54.1) su bfloat16 tikslumu, kas užtikrina efektyvų mokinimą ir išvadų darymą (angl. inference). Modeliui apmokinti buvo naudojamas specialiai šiam projektui sukurtas lietuviškas tokenizatorius su 64 000 tokenų žodynu, optimizuotas lietuvių kalbos morfologijai ir žodžio dalių segmentavimui. 8 192 tokenų konteksto ilgis leidžia modeliui efektyviai apdoroti ilgus dokumentus, išlaikyti kalbinį tikslumą ir nuoseklumą.
| Patinka | 0 |
|---|---|
| Brandos lygis | - |
| Atnaujinama | Neatnaujinamas |
| Kategorijos |
|
| Būsena | Atvertas |
| Duomenų išteklius viešinamas | Taip |
| Prieigos teisės | Vieši |
| Licencija | |
| Katalogas | |
| Prieigos nuoroda | https://huggingface.co/VSSA-SDSA/LT-MLKM-modernBE… |
| Laikotarpis | 2024 m. gruodžio 3 d. - 2025 m. lapkričio 3 d. |
| Duomenų ištekliaus sukūrimo data | 2025-10-31 09:40 |
|---|---|
| Paskutinio atnaujinimo data | 2026-04-20 09:20 |
| Teisės - Aprašymas |
Duomenų skelbėjas
Valstybės skaitmeninių sprendimų agentūra
Dalintis socialiniuose tinkluose
Prenumeruoja: 0
Duomenų pateiktys
| Pavadinimas | Dydis | Formatas | Publikuota | Atnaujinta | ||||
|---|---|---|---|---|---|---|---|---|
| Mažasis lietuvių kalbos vektorizuotas modelis | - | API | 2025-10-31 | Neatnaujinamas | Atidaryti |
Peržiūrėti
Priskirtos organizacijos
| Priskyrimo rūšis | Organizacija | |
|---|---|---|
| Duomenų rengėjas | Valstybės skaitmeninių sprendimų agentūra |