Juridinių asmenų registro paskirtis – registruoti Juridinių asmenų registro objektus ir registruoti, įrašyti, rinkti, kaupti, apdoroti, sisteminti, saugoti ir teikti duomenis, informaciją ir dokumentus apie juos. Papildyti
2026 m. liepos mėnesį dėl IT infrastruktūros atnaujinimo darbų laikinai nebus atnaujinama dalis Valstybės duomenų agentūros skelbiamų duomenų rinkinių atvirų duomenų portale. Daugiau skaitykite https://data.gov.lt/blog/2026/07/03/2026-m-liepos-m%C4%97n-duomen%C5%B3-rinkini%C5%B3-atnaujinimo-tvarka/
Juridinių asmenų registro paskirtis – registruoti Juridinių asmenų registro objektus ir registruoti, įrašyti, rinkti, kaupti, apdoroti, sisteminti, saugoti ir teikti duomenis, informaciją ir dokumentus apie juos. Papildyti
LT-MLKM-modernBERT – tai maskuotosios kalbos (MLM) tipo lietuvių kalbos modelis, sukurtas nacionalinio projekto „Bendrojo lietuvių kalbos tekstyno ir vektorizuotų modelių sukūrimas“ imtyje. Modelis paremtas ModernBERT-base architektūra ir buvo apmokintas su „Bendrojo lietuvių kalbos tekstyno“ (3 etapo) duomenimis, kurį sudarė 1,87 mlrd. žodžių arba apie 49 mlrd. mokymo tokenų iš įvairių lietuviškų šaltinių (žiniasklaidos, dokumentų, mokslinių, viešojo sektoriaus ir kitų tekstų). Modelis prisideda prie projekto tikslo – sukurti aukštos kokybės lietuvių kalbos išteklius ir didžiuosius kalbos modelius, reikalingus DI, tyrimų ir skaitmeninėms inovacijoms. Modelis yra bazinis (angl. base) ir skirtas tolesniam pritaikymui (angl. fine-tuning) bei domenų adaptacijai viešojo ir privataus sektorių projektuose, kuriems reikalingas patikimas lietuvių kalbos apdorojimas. Modelis nėra daugiafunkcinis; konkrečioms užduotims būtinas papildomas pritaikymas atitinkamam tikslui. Jis naudoja ModernBertForMaskedLM Hugging Face diegimo biblioteką (v4.54.1) su bfloat16 tikslumu, kas užtikrina efektyvų mokinimą ir išvadų darymą (angl. inference). Modeliui apmokinti buvo naudojamas specialiai šiam projektui sukurtas lietuviškas tokenizatorius su 64 000 tokenų žodynu, optimizuotas lietuvių kalbos morfologijai ir žodžio dalių segmentavimui. 8 192 tokenų konteksto ilgis leidžia modeliui efektyviai apdoroti ilgus dokumentus, išlaikyti kalbinį tikslumą ir nuoseklumą.