2026 m. liepos mėnesį dėl IT infrastruktūros atnaujinimo darbų laikinai nebus atnaujinama dalis Valstybės duomenų agentūros skelbiamų duomenų rinkinių atvirų duomenų portale. Daugiau skaitykite https://data.gov.lt/blog/2026/07/03/2026-m-liepos-m%C4%97n-duomen%C5%B3-rinkini%C5%B3-atnaujinimo-tvarka/

Rasta duomenų išteklių: 5
Publikuota: 2026-05-22 Atnaujinta: 2026-06-04 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Nuasmeninimo tekstyno sukūrimas (NUS)“, Nr. 02-100-K-0001.

Apimtis. 41 312 įrašų (13 762 478 žodžiai, 520 904 sakiniai), kiekvienas tekstas anotuotas asmens duomenų (angl. personally identifiable information, PII) atžvilgiu — iš viso 1 487 589 anotacijos. Mokymo imtis — 41 189 įrašai (administraciniai, moksliniai ir žiniasklaidos tekstai), testavimo (validacijos) imtis — 123 įrašai. Duomenys pateikiami JSONL, CoNLL-2003 (BIO) ir TEI P5 XML formatais.

Tekstyno sandara. Asmens duomenų tekstynas priskirtinas specializuotiems lietuvių kalbos tekstynams, skirtiems automatinio asmens duomenų aptikimo ir nuasmeninimo (angl. de-identification) sistemų giliojo mokymo pagrindu apmokymui bei vertinimui. Tekstyną sudaro originalūs lietuvių kalba parengti tekstai kartu su rankiniu būdu pažymėtomis asmens duomenų anotacijomis. Iš viso išskirti 24 anotacijų tipai, suskirstyti į dvi grupes: 16 bendrųjų kategorijų (PER, LOC, ORG, ID_PER, ID_MISC, NUM_PHONE, NUM_CAR, MISC, OCC, EDU, AGE, DATE, TIME, DURATION, VALUE, NAT) ir 8 BDAR specialiosios kategorijos „jautrūs" duomenys (HEALTH, REL, POL, ETH, MAR, FAM, GENDER, SEX). Jautrių duomenų anotacijos sudaro apie 2,84 proc. visų anotacijų, atspindint jų faktinį pasiskirstymą realiuose tekstuose.

Tekstyną sudaro trys skirtingos teminės dalys ir stratifikuota validacijos imtis. Proporcijos pagal žodžių skaičių: 1. administraciniai tekstai — 11 487 490 žodžių (apie 83 proc. tekstyno), 2. moksliniai tekstai — 1 108 602 žodžiai (apie 8 proc.), 3. žiniasklaidos tekstai — 1 107 917 žodžių (apie 8 proc.), 4. validacijos imtis — 58 469 žodžiai (apie 0,4 proc.).

Pagal įrašų skaičių dominuoja administracinė sritis (38 468 įrašai), toliau: žiniasklaida (2 451), moksliniai tekstai (270) ir validacijos imtis (123).

Tekstų šaltiniai. Administracinės dalies tekstai surinkti iš 111 šaltinių — Lietuvos savivaldybių ir valstybės institucijų interneto svetainių (laikotarpis 2001–2025 m.); 3,8 proc. (1 480 įrašų) šios dalies sudaro sintetiniai tekstai, sugeneruoti Gemma 2 27B modeliu ir atitinkamai pažymėti (original_id prefiksas translated_synthetic_admin_texts_*). Mokslinės dalies tekstai paimti iš VDU CRIS (Lituanistikos duomenų bazės) ir atvirosios prieigos Vilniaus universiteto leidyklos žurnalų (laikotarpis 2000–2025 m.). Žiniasklaidos dalies tekstai — Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti straipsniai (2019–2020 m. archyvas ir 2024–2025 m. svetainės surinkimas). Validacijos imtis — filtruotas pirmiau išvardytų šaltinių poaibis, atspindintis visų trijų dalykinių sričių pasiskirstymą.

Projekto tikslas. Parengti ne mažiau kaip 10 mln. žodžių nuasmeninimo tekstyną, kuriame būtų sužymėtos BDAR aktualios įvardintos esybės (angl. named entities), atspindinčios bendrą asmeninę informaciją apie realaus pasaulio asmenis, tokiu būdu sudarant galimybes tekstyną naudoti automatizuotam duomenų anonimizavimui/ užkodavimui pagal BDAR reikalavimus ir mašininio arba giliojo mokymo technologijų sprendimų apmokymui.

Tekstyno pagrindu parengti giliojo mokymosi sprendimai. Remiantis šio tekstyno duomenimis, parengtas automatinis asmeninės informacijos aptikimo modelis lietuvių kalbai:

  1. Nuasmeninimo modelis, paremtas XLM-RoBERTa architektūra: NUS-LT-PII-xlm-roberta-large (https://huggingface.co/VytautoDidziojoUniversitetas/NUS-LT-PII-xlm-roberta-large).

46
1
0
Publikuota: 2026-05-22 Atnaujinta: 2026-05-22 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Santraukų tekstynai dirbtiniam intelektui“, Nr. 02-101-K-0001.

Apimtis: 2340 tekstų (1 738 609 žodžiai), kiekvienas tekstas suporuotas su dviem žmonių parengtomis santraukomis: abstraktyvia (iš viso 352 591 žodis) ir ekstraktyvia (iš viso 494 861 žodis). Mokymo imtis – 2240 tekstų, testavimo imtis – 100 tekstų. Duomenys pateikiami CSV, JSON ir XML formatais.

Tekstyno sandara. Santraukų tekstynas priskirtinas specializuotiems lietuvių kalbos tekstynams, skirtiems automatinio santraukų sudarymo (angl. automatic summarisation) sistemų giliojo mokymo pagrindu apmokymui ir vertinimui. Tekstyną sudaro originalūs lietuvių autorių parengti tekstai kartu su žmonių parašytomis abstraktyviomis ir ekstraktyviomis santraukomis. Kiekviena santrauka sudaro ne mažiau kaip 10 proc. originalaus teksto apimties.

Tekstyną sudaro keturios skirtingos dalys: informacinių technologijų (IT), teisės (teisė), medicinos (medicina) ir žiniasklaidos (žiniasklaida). Proporcijos: 1. teisės tekstai – 668 276 žodžiai (apie 38 proc. tekstyno), 2. medicinos tekstai – 371 611 žodžių (apie 21 proc.), 3. žiniasklaidos tekstai – 354 012 žodžių (apie 20 proc.), 4. informacinių technologijų tekstai – 344 710 žodžių (apie 20 proc.).

Pagal tekstų skaičių dominuoja informacinių technologijų sritis (689 tekstai), toliau: žiniasklaida (568), medicina (550) ir teisė (533).

Tekstų šaltiniai. Informacinių technologijų dalies tekstai surinkti iš IT tinklaraščių (pvz., technologijos.lt), studentų bakalauro ir magistro baigiamųjų darbų (pvz., VDU CRIS) bei Vilniaus universiteto IT mokslo žurnalų (zurnalai.vu.lt). Teisės dalies tekstai paimti iš Lietuvos teismų informacinės sistemos LITEKO, Lietuvos Respublikos teisės aktų registro, Lietuvos Aukščiausiojo Teismo jurisprudencijos, teisės publikacijų (pvz., teise.pro) ir mokslinių straipsnių (pvz., elaba.lt). Medicinos dalies tekstai – Valstybės duomenų agentūros parengti anonimizuoti vaistinių dokumentai ir gydytojų diagnozės. Žiniasklaidos dalies tekstai – Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti straipsniai.

Projekto tikslas. Parengti ir validuoti mišrius lietuvių kalbos tekstų santraukų / abstraktų tekstynus, skirtus automatinio sudarymo giliojo mokymo pagrindu veikiančių sistemų apmokymui. Projektas vykdomas Vytauto Didžiojo universiteto kartu su partneriu Vilniaus universitetu pagal planą „Naujos kartos Lietuva“ (komponentas „Skaitmeninė transformacija ekonomikos augimui“), projekto Nr. 02-101-K-0001.

Tekstyno pagrindu parengti giliojo mokymosi sprendimai. Remiantis šio tekstyno duomenimis, parengti du automatinio santraukų sudarymo modeliai lietuvių kalbai: 1. ekstraktyvaus santraukų sudarymo modelis, paremtas XLM-RoBERTa architektūra: LT-ABS-extractive-xlm-roberta (https://huggingface.co/VytautoDidziojoUniversitetas/LT-ABS-extractive-xlm-roberta); 2. abstraktyvaus santraukų sudarymo modelis, paremtas Gemma 3 12B architektūra: LT-ABS-abstractive-Gemma3-12b (https://huggingface.co/VytautoDidziojoUniversitetas/LT-ABS-abstractive-Gemma3-12b).

42
1
0
Publikuota: 2026-05-15 Atnaujinta: 2026-06-19 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Morfologiškai ir sintaksiškai anotuotų tekstynų modeliai apmokymui (auksiniai standartai)“, Nr. 02-098-K-0001.

Dydis: 10 010 420 žodžių; 12 221 575 tekstyno vienetai (žodžiai, skaitmenys, simboliai, skyrybos ženklai); 668 969 sakiniai.

Tekstyno sandara. SIMAS priskirtinas bendriesiems anotuotiems rašomosios kalbos tekstynams. Tekstyną sudaro tekstai, parašyti ir publikuoti 2000–2025 m. laikotarpiu, reprezentuojama originalioji dabartinė bendrinė rašytinė lietuvių kalba. Tekstynas susideda iš keturių skirtingus stilius atspindinčių dalių: grožinės, mokslinės, administracinės literatūros ir periodikos (tai Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti tekstai). Proporcijos: periodika (įvairiatemiai ir įvairiažanriai straipsniai iš LRT.lt ) – 4 852 550 žodžių (apie 50 proc. tekstyno). Dokumentai sudaro 2 085 581 žodį, mokslinės literatūros tekstai (įvairių mokslo sričių knygos ir straipsniai) sudaro 2 108 574 žodžius (po 20 proc. tekstyno), o grožinės literatūros tekstai – 963 632 žodžius (apie 10 proc. tekstyno). Tekstyne sukaupti tik lietuvių autorių sukurti originalūs grožinio ir mokslinio stiliaus tekstai, vertimų neįtraukta. Visose tekstyno dalyse yra pilni tekstai, o ne tekstų fragmentai.

Anotavimo įrankiai. Tekstynas automatiškai anotuotas morfologiškai ir sintaksiškai, lingvistų peržiūrėtas. Automatiniam morfologiniam anotavimui naudotas įrankis „Morfuoklis“ (https://sitti.vdu.lt/morfuoklis/lt). Automatinei sintaksinei analizei naudotas tarptautinis įrankis UDPipe (https://lindat.mff.cuni.cz/services/udpipe/) , pritaikytas lietuvių kalbai.

57
2
0
Publikuota: 2024-08-01 Atnaujinta: 2026-04-07 Valstybės duomenų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Rinkinyje yra pateikiami tekstai, pilni ir išskaidyti pastraipomis, iš Lietuvių kalbos instituto moderniosios tapatybės ideologinio naratyvo publicistikos tekstyno. Šis tekstynas – tekstų duomenų bazė, kuri naudojama lingvistinei, statistinei ir sociologinei rašytinės kalbos analizei. Duomenys į šią duomenų bazę buvo rinkti nuo 2018 iki 2021 metų. Tekstyne galima rasti prieškario (1928 ir 1930 m.), sovietinio laikotarpio (1945, 1956–1957, 1962 m.) ir atkurtos nepriklausomos Lietuvos spaudos (1992 ir 1998 m.) įvairių mėnesių tekstus. Kiti šių duomenų atnaujinimai galimi ateityje, Lietuvių kalbos institutui vykdant papildomus duomenų rinkimo projektus.

Su duomenimis susijusiais klausimais prašome kreiptis el. paštu atverimas@stat.gov.lt. Dėl techninių portalo veiklos sutrikimų prašome kreiptis el. paštu atviriduomenys@vssa.lt.

170
0
0
Publikuota: 2024-04-15 Atnaujinta: 2026-04-07 Valstybės duomenų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Rinkinyje pateikiami teisės aktų registro duomenys. Rinkinys susideda iš dviejų modelių: dokumentų ir jų suvestinių. Pateikiami duomenys apie teisės aktų objektus, juos parengusius ir priėmusius subjektus, identifikacinius kodus, objektų rūšis, pavadinimus ir jų chronologijas (teisės akto priėmimo data, registravimo Registre data, paskelbimo data, įsigaliojimo data, pakeitimo ar papildymo data, pripažinimo netekusiu galios data, galiojimo sustabdymo data, galiojimo terminas). Registro objektai yra šie teisės aktai: 1) Lietuvos Respublikos Konstitucija; 2) konstituciniai įstatymai; 3) kiti įstatymai; 4) Lietuvos Respublikos Seimo statutas; 5) Lietuvos Respublikos Seimo (toliau – Seimas) nutarimai; 6) kiti Seimo priimti teisės aktai; 7) Lietuvos Respublikos tarptautinės sutartys; 8) Respublikos Prezidento dekretai ir potvarkiai; 9) Lietuvos Respublikos Vyriausybės (toliau – Vyriausybė) nutarimai, sprendimai ir rezoliucijos; 10) Lietuvos Respublikos Konstitucinio Teismo (toliau – Konstitucinis Teismas) reglamentas; 11) ministrų, Vyriausybės įstaigų, kitų valstybės institucijų ir įstaigų vadovų bei kolegialių institucijų norminiai teisės aktai; 12) Ministro Pirmininko potvarkiai; 13) Seimo Pirmininko potvarkiai; 14) Seimo valdybos sprendimai; 15) Lietuvos banko norminiai teisės aktai; 16) savivaldybių institucijų norminiai teisės aktai, taip pat savivaldybių merų priimami teisės aktai, kuriuos skelbti Registre privaloma pagal teisės aktų reikalavimus; 17) įgaliotų atlikti viešąjį administravimą asociacijų, valstybės ar savivaldybės įmonių, viešųjų įstaigų, kurių savininkė ar dalininkė yra valstybė ar savivaldybė, valdymo organų priimti norminiai teisės aktai. Kitų asociacijų, valstybės ar savivaldybės įmonių, viešųjų įstaigų, kurių savininkė ar dalininkė yra valstybė ar savivaldybė, valdymo organų priimti teisės aktai Registro objektais yra tik tais atvejais, kai šiuos teisės aktus skelbti Registre privaloma pagal teisės aktų reikalavimus; 18) ministrų, Vyriausybės įstaigų, kitų valstybės ir savivaldybių institucijų ir įstaigų vadovų ir kolegialių institucijų, taip pat Lietuvos banko valdybos ar valdybos pirmininko, teisės aktų nustatyta tvarka įgaliotų atlikti viešąjį administravimą asociacijų, valstybės ar savivaldybės įmonių, viešųjų įstaigų, kurių savininkė ar dalininkė yra valstybė ar savivaldybė, valdymo organų priimti teisės taikymo aktai, kuriuos skelbti Registre privaloma pagal teisės aktų reikalavimus; 19) Konstitucinio Teismo nutarimai ir sprendimai dėl Konstitucinio Teismo nutarimo išaiškinimo, taip pat Konstitucinio Teismo pirmininko pranešimai dėl ginčijamo akto galiojimo sustabdymo ir dėl sustabdyto akto galiojimo atnaujinimo; 20) Lietuvos Aukščiausiojo Teismo ir Lietuvos vyriausiojo administracinio teismo sprendimai, nutartys, nutarimai, taip pat įsiteisėję administracinių teismų sprendimai dėl norminių administracinių aktų teisėtumo.

Duomenų teikėjas – Lietuvos Respublikos Seimo kanceliarija.

Su duomenimis susijusiais klausimais prašome kreiptis el. paštu atverimas@stat.gov.lt. Dėl techninių portalo veiklos sutrikimų prašome kreiptis el. paštu atviriduomenys@vssa.lt.

2025-06-13: pridėti teisės aktų suvestinių duomenys. Suvestinių tekstus šiuo metu galima pasiekti pagal pateiktą nuorodą. 2026-03-02: pridėti teisės aktų priedų tekstiniai duomenys (nuskaitomi docs, pdf tekstai).

1874
0
0