2026 m. liepos mėnesį dėl IT infrastruktūros atnaujinimo darbų laikinai nebus atnaujinama dalis Valstybės duomenų agentūros skelbiamų duomenų rinkinių atvirų duomenų portale. Daugiau skaitykite https://data.gov.lt/blog/2026/07/03/2026-m-liepos-m%C4%97n-duomen%C5%B3-rinkini%C5%B3-atnaujinimo-tvarka/

Rasta duomenų išteklių: 186
Publikuota: 2026-05-22 Atnaujinta: 2026-06-04 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Nuasmeninimo tekstyno sukūrimas (NUS)“, Nr. 02-100-K-0001.

Apimtis. 41 312 įrašų (13 762 478 žodžiai, 520 904 sakiniai), kiekvienas tekstas anotuotas asmens duomenų (angl. personally identifiable information, PII) atžvilgiu — iš viso 1 487 589 anotacijos. Mokymo imtis — 41 189 įrašai (administraciniai, moksliniai ir žiniasklaidos tekstai), testavimo (validacijos) imtis — 123 įrašai. Duomenys pateikiami JSONL, CoNLL-2003 (BIO) ir TEI P5 XML formatais.

Tekstyno sandara. Asmens duomenų tekstynas priskirtinas specializuotiems lietuvių kalbos tekstynams, skirtiems automatinio asmens duomenų aptikimo ir nuasmeninimo (angl. de-identification) sistemų giliojo mokymo pagrindu apmokymui bei vertinimui. Tekstyną sudaro originalūs lietuvių kalba parengti tekstai kartu su rankiniu būdu pažymėtomis asmens duomenų anotacijomis. Iš viso išskirti 24 anotacijų tipai, suskirstyti į dvi grupes: 16 bendrųjų kategorijų (PER, LOC, ORG, ID_PER, ID_MISC, NUM_PHONE, NUM_CAR, MISC, OCC, EDU, AGE, DATE, TIME, DURATION, VALUE, NAT) ir 8 BDAR specialiosios kategorijos „jautrūs" duomenys (HEALTH, REL, POL, ETH, MAR, FAM, GENDER, SEX). Jautrių duomenų anotacijos sudaro apie 2,84 proc. visų anotacijų, atspindint jų faktinį pasiskirstymą realiuose tekstuose.

Tekstyną sudaro trys skirtingos teminės dalys ir stratifikuota validacijos imtis. Proporcijos pagal žodžių skaičių: 1. administraciniai tekstai — 11 487 490 žodžių (apie 83 proc. tekstyno), 2. moksliniai tekstai — 1 108 602 žodžiai (apie 8 proc.), 3. žiniasklaidos tekstai — 1 107 917 žodžių (apie 8 proc.), 4. validacijos imtis — 58 469 žodžiai (apie 0,4 proc.).

Pagal įrašų skaičių dominuoja administracinė sritis (38 468 įrašai), toliau: žiniasklaida (2 451), moksliniai tekstai (270) ir validacijos imtis (123).

Tekstų šaltiniai. Administracinės dalies tekstai surinkti iš 111 šaltinių — Lietuvos savivaldybių ir valstybės institucijų interneto svetainių (laikotarpis 2001–2025 m.); 3,8 proc. (1 480 įrašų) šios dalies sudaro sintetiniai tekstai, sugeneruoti Gemma 2 27B modeliu ir atitinkamai pažymėti (original_id prefiksas translated_synthetic_admin_texts_*). Mokslinės dalies tekstai paimti iš VDU CRIS (Lituanistikos duomenų bazės) ir atvirosios prieigos Vilniaus universiteto leidyklos žurnalų (laikotarpis 2000–2025 m.). Žiniasklaidos dalies tekstai — Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti straipsniai (2019–2020 m. archyvas ir 2024–2025 m. svetainės surinkimas). Validacijos imtis — filtruotas pirmiau išvardytų šaltinių poaibis, atspindintis visų trijų dalykinių sričių pasiskirstymą.

Projekto tikslas. Parengti ne mažiau kaip 10 mln. žodžių nuasmeninimo tekstyną, kuriame būtų sužymėtos BDAR aktualios įvardintos esybės (angl. named entities), atspindinčios bendrą asmeninę informaciją apie realaus pasaulio asmenis, tokiu būdu sudarant galimybes tekstyną naudoti automatizuotam duomenų anonimizavimui/ užkodavimui pagal BDAR reikalavimus ir mašininio arba giliojo mokymo technologijų sprendimų apmokymui.

Tekstyno pagrindu parengti giliojo mokymosi sprendimai. Remiantis šio tekstyno duomenimis, parengtas automatinis asmeninės informacijos aptikimo modelis lietuvių kalbai:

  1. Nuasmeninimo modelis, paremtas XLM-RoBERTa architektūra: NUS-LT-PII-xlm-roberta-large (https://huggingface.co/VytautoDidziojoUniversitetas/NUS-LT-PII-xlm-roberta-large).

46
1
0
Publikuota: 2026-05-22 Atnaujinta: 2026-05-22 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Santraukų tekstynai dirbtiniam intelektui“, Nr. 02-101-K-0001.

Apimtis: 2340 tekstų (1 738 609 žodžiai), kiekvienas tekstas suporuotas su dviem žmonių parengtomis santraukomis: abstraktyvia (iš viso 352 591 žodis) ir ekstraktyvia (iš viso 494 861 žodis). Mokymo imtis – 2240 tekstų, testavimo imtis – 100 tekstų. Duomenys pateikiami CSV, JSON ir XML formatais.

Tekstyno sandara. Santraukų tekstynas priskirtinas specializuotiems lietuvių kalbos tekstynams, skirtiems automatinio santraukų sudarymo (angl. automatic summarisation) sistemų giliojo mokymo pagrindu apmokymui ir vertinimui. Tekstyną sudaro originalūs lietuvių autorių parengti tekstai kartu su žmonių parašytomis abstraktyviomis ir ekstraktyviomis santraukomis. Kiekviena santrauka sudaro ne mažiau kaip 10 proc. originalaus teksto apimties.

Tekstyną sudaro keturios skirtingos dalys: informacinių technologijų (IT), teisės (teisė), medicinos (medicina) ir žiniasklaidos (žiniasklaida). Proporcijos: 1. teisės tekstai – 668 276 žodžiai (apie 38 proc. tekstyno), 2. medicinos tekstai – 371 611 žodžių (apie 21 proc.), 3. žiniasklaidos tekstai – 354 012 žodžių (apie 20 proc.), 4. informacinių technologijų tekstai – 344 710 žodžių (apie 20 proc.).

Pagal tekstų skaičių dominuoja informacinių technologijų sritis (689 tekstai), toliau: žiniasklaida (568), medicina (550) ir teisė (533).

Tekstų šaltiniai. Informacinių technologijų dalies tekstai surinkti iš IT tinklaraščių (pvz., technologijos.lt), studentų bakalauro ir magistro baigiamųjų darbų (pvz., VDU CRIS) bei Vilniaus universiteto IT mokslo žurnalų (zurnalai.vu.lt). Teisės dalies tekstai paimti iš Lietuvos teismų informacinės sistemos LITEKO, Lietuvos Respublikos teisės aktų registro, Lietuvos Aukščiausiojo Teismo jurisprudencijos, teisės publikacijų (pvz., teise.pro) ir mokslinių straipsnių (pvz., elaba.lt). Medicinos dalies tekstai – Valstybės duomenų agentūros parengti anonimizuoti vaistinių dokumentai ir gydytojų diagnozės. Žiniasklaidos dalies tekstai – Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti straipsniai.

Projekto tikslas. Parengti ir validuoti mišrius lietuvių kalbos tekstų santraukų / abstraktų tekstynus, skirtus automatinio sudarymo giliojo mokymo pagrindu veikiančių sistemų apmokymui. Projektas vykdomas Vytauto Didžiojo universiteto kartu su partneriu Vilniaus universitetu pagal planą „Naujos kartos Lietuva“ (komponentas „Skaitmeninė transformacija ekonomikos augimui“), projekto Nr. 02-101-K-0001.

Tekstyno pagrindu parengti giliojo mokymosi sprendimai. Remiantis šio tekstyno duomenimis, parengti du automatinio santraukų sudarymo modeliai lietuvių kalbai: 1. ekstraktyvaus santraukų sudarymo modelis, paremtas XLM-RoBERTa architektūra: LT-ABS-extractive-xlm-roberta (https://huggingface.co/VytautoDidziojoUniversitetas/LT-ABS-extractive-xlm-roberta); 2. abstraktyvaus santraukų sudarymo modelis, paremtas Gemma 3 12B architektūra: LT-ABS-abstractive-Gemma3-12b (https://huggingface.co/VytautoDidziojoUniversitetas/LT-ABS-abstractive-Gemma3-12b).

42
1
0
Publikuota: 2026-05-15 Atnaujinta: 2026-06-19 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Morfologiškai ir sintaksiškai anotuotų tekstynų modeliai apmokymui (auksiniai standartai)“, Nr. 02-098-K-0001.

Dydis: 10 010 420 žodžių; 12 221 575 tekstyno vienetai (žodžiai, skaitmenys, simboliai, skyrybos ženklai); 668 969 sakiniai.

Tekstyno sandara. SIMAS priskirtinas bendriesiems anotuotiems rašomosios kalbos tekstynams. Tekstyną sudaro tekstai, parašyti ir publikuoti 2000–2025 m. laikotarpiu, reprezentuojama originalioji dabartinė bendrinė rašytinė lietuvių kalba. Tekstynas susideda iš keturių skirtingus stilius atspindinčių dalių: grožinės, mokslinės, administracinės literatūros ir periodikos (tai Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti tekstai). Proporcijos: periodika (įvairiatemiai ir įvairiažanriai straipsniai iš LRT.lt ) – 4 852 550 žodžių (apie 50 proc. tekstyno). Dokumentai sudaro 2 085 581 žodį, mokslinės literatūros tekstai (įvairių mokslo sričių knygos ir straipsniai) sudaro 2 108 574 žodžius (po 20 proc. tekstyno), o grožinės literatūros tekstai – 963 632 žodžius (apie 10 proc. tekstyno). Tekstyne sukaupti tik lietuvių autorių sukurti originalūs grožinio ir mokslinio stiliaus tekstai, vertimų neįtraukta. Visose tekstyno dalyse yra pilni tekstai, o ne tekstų fragmentai.

Anotavimo įrankiai. Tekstynas automatiškai anotuotas morfologiškai ir sintaksiškai, lingvistų peržiūrėtas. Automatiniam morfologiniam anotavimui naudotas įrankis „Morfuoklis“ (https://sitti.vdu.lt/morfuoklis/lt). Automatinei sintaksinei analizei naudotas tarptautinis įrankis UDPipe (https://lindat.mff.cuni.cz/services/udpipe/) , pritaikytas lietuvių kalbai.

57
2
0
Publikuota: 2026-05-13 Atnaujinta: 2026-05-13 Vilniaus universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

Lietuvių kalbos garsynas LIEPA-3 yra skirtas šnekos atpažinimo (ASR, STT) taikymams ir moksliniams tyrimams. Bendra anotuota garsyno trukmė yra 10000 val. Garsyną sudaro garso įrašai FLAC formatu (44.1 kHz, 16 bitų, mono) ir juos atitinkantys anotacijų failai teksto formatu žodžio bei frazių lygmens anotacijose bei Praat TextGrid (https://praat.org/) formatu foneminėse anotacijose. Garsyne įrašyta skaitoma šneka, spontaninė šneka ir lietuviškos tarmės. Garsynas sąlyginai sudalintas į kelis subgarsynus: spontaninės šnekos (SPON - 4900 val.), skaitomos šnekos (READ - 5000 val.), tarmių (DIAL - 100 val.) bei fonemiškai anotuotą garsyną (PHON - 500 val.). Bendras garsyno dydis yra 1,3 TB (ZIP formatas, dalys atsisiuntimui po 10 GB). Garsynas anotuotas fonemų lygmenyje (500 valandų), žodžių (10 000 valandų) ir frazių (10 000 valandų) lygmenyse.

150
0
1
Publikuota: 2026-05-10 Atnaujinta: 2026-07-19 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

62
0
0
Publikuota: 2026-05-10 Atnaujinta: 2026-07-19 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

21
0
0
Publikuota: 2026-05-10 Atnaujinta: 2026-07-19 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

40
0
0
Publikuota: 2026-05-10 Atnaujinta: 2026-07-19 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

18
0
0
Publikuota: 2026-05-10 Atnaujinta: 2026-07-19 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR duomenų vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalios padėties nustatymo paklaida – ne daugiau kaip 30 cm; vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, vertikalios padėties nustatymo paklaida – ne daugiau kaip 10 cm; nominalus skenavimo impulsų tankis – ne mažesnis kaip 15 taškų/kv. m.

LIDAR duomenys suklasifikuoti į šias klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (angl. Low Vegetation); • 4 klasė – vidurinė augmenija (angl. Medium Vegetation); • 5 klasė – aukšta augmenija (angl. High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – triukšmo taškai (angl. Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). LIDAR duomenų surinkimo laikotarpis – gegužės-spalio mėn.

Duomenys klasifikuoti automatiniu būdu, dėl to gali pasitaikyti taškų priskyrimo neteisingai klasei atvejų.

Skirtingai nuo ankstesnių metų, 2025 m. duomenų rinkimui naudoti RIEGL skeneriai, dėl to LAZ failai gali turėti papildomų dimensijų (atributų): „Amplitude“, „Reflectance“, „Deviation“. Tokių failų su papildomomis dimensijomis gali neperskaityti kai kurios programinės įrangos LAS failų skaitytuvai. Perrašyti LAZ failą be papildomų dimensijų galima naudojant programą „OSGeo4W“ (atsisiuntimo nuoroda: https://qgis.org/download/?skip_donate=true, įprastai ji įdiegiama kartu su „QGIS“ programine įranga). Atsidarius „OSGeo4W Shell“ aplinką, komandinėje eilutėje iškviečiama PDAL funkcija translate, pavyzdžiui: pdal translate "C:\įvesties_failo_vieta\failo_pavadinimas.laz" "C:\išvesties_failo_vieta\failo_pavadinimas.laz" Įrašytas išvesties failas papildomų dimensijų paprastai neturi, nes translate funkcija naudoja numatytą LAS rašytuvą, kuris jų neįrašo. Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

43
0
0
Publikuota: 2026-05-07 Atnaujinta: 2026-05-08 Lietuvių kalbos institutas
Duomenų išteklius viešinamas: Taip Brandos lygis:

Bendrąjį lietuvių kalbos paveldo duomenyną sudaro 500 tūkst. vienetų lietuvių kalbos leksikografijos, tarmių ir vardyno medžiagos objektų (kalbos duomenų kortelių). Objektą sudaro skenuotas kortelės vaizdas JPG formatu bei kortelės duomenys XML įraše. Duomenyne skelbiami „Lietuvių kalbos žodyno“ Pagrindinė kartotekos, „Lietuvių kalbos žodyno“ Papildymų kartotekos ir Vietovardžių, surinktų iš gyvosios kalbos, kartotekos duomenys.

XML
25
0
0
Publikuota: 2026-04-20 Atnaujinta: 2026-06-02 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Anotuotas garsynas, skirtas šnekos sintezės tikslams neuroniniams balsams generuoti ir dirbtinio intelekto technologijų sprendimų poreikių tenkinimui. Šis garsynas - kompleksinis kalbos išteklius, kurį sudaro pagrindinis (šnekos sintezei) ir papildomas (emocinis) garsynai. Anotuotas garsynas – rinkinys, susidedantis iš garso įrašų ir juos atitinkančių tekstinių transkripcijų ir anotacijų. Šnekos sintezei skirtas anotuotas garsynas - aukštos kokybės garsynas, kuris būtinas siekiant sukurti balsus, kurie skamba natūraliai ir gali būti pritaikyti įvairiose srityse – nuo kasdienių užduočių iki specializuotų profesionalių sprendimų. Emocinis anotuotas garsynas - specializuotas kalbos duomenų rinkinys, skirtas rinkti, saugoti ir analizuoti kalbos įrašus, kuriuose yra aiškiai išreikštos skirtingos emocinės būsenos. Šis garsynas apima įrašus, kuriuose kalbėtojai sąmoningai išreiškia emocijas, tokias kaip džiaugsmas, liūdesys, pyktis, baimė, nuostaba. Šie duomenys yra kruopščiai anotuoti pagal emocines kategorijas ir kitus su emocijomis susijusius parametrus, tokius kaip intonacija, tempas, kalbos garsumas ir ritmas.

76
0
0
Publikuota: 2026-04-20 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Medicinos garsyną sudaro 418 valandų profesionalios medicininės šnekos duomenų, įrašytų realioje medicinos darbo aplinkoje (garso įrašai ir jų anotacijos, įskaitant transkripcijas). Įrašai yra lietuvių kalba, tačiau juose taip pat vartojami lotyniški terminai, naudojami pagal standartinę praktiką. Garsyno turinys yra anonimizuotas ir atspindi medicinos specialistų vartojamą žodyną šeimos medicinos (bendrosios praktikos) ir radiologijos (magnetinio rezonanso tomografijos (MRT), rentgenografijos (rentgeno), kompiuterinės tomografijos (KT), ultragarsinio tyrimo (sonografijos) srityse. Šeimos medicinos ir radiologijos įrašų santykis yra 50% / 50%. Vyrų ir moterų garso įrašų santykis yra 50% / 50%. Kalbėtojai suskirstyti į tris amžiaus grupes pagal balso charakteristikas: jaunatviško, brandaus ir subrendusio balso amžiaus grupės. Garso įrašai pateikiami .wav formatu, anotacijos (įskaitant transkripcijas) pateikiamos .TextGrid, .parquet ir .json formatais. Finansuoja Ekonomikos gaivinimo ir atsparumo didinimo priemonės planas „Naujos kartos Lietuva“ ir NextGenerationEU.

61
0
0
Publikuota: 2026-04-20 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Tai stambios apimties, plačios teminės aprėpties lietuvių kalbos klausimų–atsakymų porų tekstynas, sukurtas dirbtinio intelekto priemonėmis remiantis viešai prieinama informacija iš įvairių šaltinių, įskaitant administracinių ir viešųjų elektroninių paslaugų portalus, enciklopedinius ir statistinius šaltinius, valstybinių institucijų ir savivaldybių portalus, teisės aktų ir duomenų portalus, naujienų bei žiniasklaidos šaltinius ir vartotojų generuojamą turinį. Tekstynas buvo formuojamas taikant transformacinį generavimo procesą, kurio metu pagal šaltiniuose esančią informaciją buvo automatiškai sukurtos naujos klausimų–atsakymų poros lietuvių kalba. Į galutinį tekstyną nebuvo įtraukti originalūs šaltinių tekstai, jų pilni įrašai ar pirminė jų forma. Tekstyną sudaro tik sugeneruotas turinys, skirtas pokalbių robotų kūrimui, lietuvių kalbos DI sistemų vystymui ir kitų dirbtinio intelekto sprendimų poreikiams Finansuoja Ekonomikos gaivinimo ir atsparumo didinimo priemonės planas „Naujos kartos Lietuva“ ir NextGenerationEU.

39
0
0
Publikuota: 2026-04-20 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Modelis sukurtas kaip tęstinės lietuvių kalbos modelių plėtros dalis, naudojant Bendrąjį lietuvių kalbos tekstyną ir specialiai šiam modeliui parengtą 32 768 tokenų žodyną (tokenizerį). Sukurtas tyrimams, išankstiniam mokymui nuo nulio ir tolesniam pritaikymui lietuvių kalbos generavimo bei kalbos technologijų užduotyse. Modelio svoriai buvo inicializuoti atsitiktine tvarka, o mokymas vykdytas dviem etapais, naudojant Lietuvių kalbos tekstyno apdorotą variantą, parengtą ilgo konteksto mokymui. Modeliui buvo naudojamas specialiai apmokytas 32 000 tokenų tokenizeris. Turėdamas apie 1,04 mlrd. parametrų ir palaikydamas maksimalų 32 768 tokenų konteksto ilgį, modelis yra pritaikytas efektyviai apdoroti ilgus lietuviškus tekstus ir mišraus domeno turinį. Jis skirtas naudoti kaip bazinis generatyvinis modelis tolesniam papildomam mokymui, domeniniam adaptavimui ir eksperimentams lietuvių kalbos NLP srityje. Pagal nutylėjimą modelis nėra instruktavimui pritaikytas ar specializuotas konkrečioms užduotims. Norint jį taikyti pokalbių sistemoms, santraukų sudarymui, klasifikavimui ar domeniškai specifiniam generavimui, rekomenduojamas papildomas mokymas ir vertinimas. Finansuoja Ekonomikos gaivinimo ir atsparumo didinimo priemonės planas „Naujos kartos Lietuva“ ir NextGenerationEU.

28
0
0
Publikuota: 2026-04-14 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Duomenų rinkinį sudaro sintetiniai lygiagretūs tekstynai šioms kalbų poroms: lietuvių-anglų, lietuvių-prancūzų ir lietuvių-vokiečių. Tekstynai skirti neuroninių mašininio vertimo ir kitų natūralios kalbos apdorojimo uždavinių sprendimui. Rinkinį sudaro daugiau kaip 3 milijonai lygiagrečių sakinių porų, po daugiau kaip 1 milijoną kiekvienai kalbų porai. Duomenys generuoti taikant kontekstinių šablonų metodą, leidžiantį sistemingai įtraukti įvardintas esybes (pvz., asmenvardžius, vietovardžius, organizacijas ir kt.) bei užtikrinti jų vartojimą įvairiose gramatinėse formose. Papildomai lietuvių-anglų dalyje integruota medicininė terminija, paremta struktūruotais medicinos srities terminų rinkiniais. Kartu pateikiami ir ištekliai, naudoti sintetinių tekstynų generavimui: daugiau kaip 20 tūkst. įvardintų esybių kiekvienai kalbų porai (11 įvardintų esybių kategorijų), taip pat daugiau kaip 50 kontekstinių šablonų kiekvienai kategorijai. Tekstynai pasižymi kontroliuojama struktūra ir lingvistine įvairove, nes sakiniai generuoti iš realių kalbos vartojimo pavyzdžių pagrindu sukurtų šablonų. Duomenys pateikiami lygiagrečia forma, užtikrinant tiesioginį sakinių atitikimą tarp kalbų, ir yra tinkami tiesioginiam naudojimui modelių treniravimui. Rinkinys pateikiamas TXT ir TMX formatais, leidžiančiais naudoti jį tiek mašininio mokymosi aplinkose, tiek vertimo atmintis naudojančioje programinėje įrangoje. Šis išteklius ypač naudingas užduotims, susijusioms su įvardintų esybių ir specializuotos terminijos vertimu, taip pat modelių testavimui ir klaidų analizei.

26
0
0
Publikuota: 2026-04-14 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Daugiakalbių (paralelinių) ir vienakalbių tekstynų rinkinys, skirtas natūralios kalbos apdorojimo, mašininio vertimo ir kitų dirbtinio intelekto technologijų taikymams. Kalbos: lietuvių, ispanų, ukrainiečių, norvegų, švedų ir danų. Išteklių sudaro vienakalbiai tekstynai ir daugiakalbiai (paraleliniai) tekstynai, apimantys bendrosios, informacinių technologijų ir teisės sričių tekstus. Duomenų kiekiai: • Ispanų vienakalbis tekstynas - ≥ 8 mln. sakinių. • Ukrainiečių vienakalbis tekstynas - ≥ 8 mln. sakinių. • Norvegų vienakalbis tekstynas - ≥ 8 mln. sakinių. • Švedų vienakalbis tekstynas - ≥ 8 mln. sakinių. • Danų vienakalbis tekstynas - ≥ 8 mln. sakinių. • Ispanų–lietuvių lygiagretus tekstynas - ≥ 4 mln. lygiagrečių sakinių. • Ukrainiečių–lietuvių lygiagretus tekstynas - ≥ 1 mln. lygiagrečių sakinių. • Norvegų–lietuvių lygiagretus tekstynas - ≥ 1 mln. lygiagrečių sakinių. • Švedų–lietuvių lygiagretus tekstynas - ≥ 1 mln. lygiagrečių sakinių. • Danų–lietuvių lygiagretus tekstynas - ≥ 1 mln. lygiagrečių sakinių. Duomenys pateikiami šiais formatais: TXT (vienakalbiai tekstai) ir TMX (paraleliniai tekstai), naudojant UTF-8 koduotę. Papildomai pateikiami metaduomenys ir statistinė informacija. Ištekliai skirti mašininio vertimo sistemų kūrimui ir vertinimui, kalbos modelių mokymui, daugiakalbių NLP sprendimų vystymui, lingvistiniams tyrimams bei vertimo technologijoms (CAT, vertimo atmintims). Kuriant tekstynus užtikrinta duomenų kokybė: vienakalbiuose tekstynuose rašybos klaidų lygis neviršija 0,5 %, o paraleliniuose tekstynuose lygiavimo klaidų kiekis neviršija 2,5 %.

25
0
0
Publikuota: 2026-04-14 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Atnaujintų vienakalbių ir daugiakalbių (paralelinių) tekstynų rinkinys, skirtas natūralios kalbos apdorojimo, mašininio vertimo ir kitų dirbtinio intelekto technologijų taikymams. Kalbos: lietuvių, anglų, prancūzų, vokiečių ir lenkų. Išteklių sudaro vienakalbiai tekstynai (≥ 1 mln. sakinių kiekvienai kalbai) ir daugiakalbiai (paraleliniai) tekstynai (≥ 0,4 mln. sakinių porų kiekvienai kalbų porai). Duomenų kiekiai: • Lietuvių vienakalbis tekstynas – 4.1 mln. sakinių. • Anglų vienakalbis tekstynas – 1.6 mln. sakinių. • Prancūzų vienakalbis tekstynas – 3 mln. sakinių. • Vokiečių vienakalbis tekstynas – 1.1 mln. sakinių. • Lenkų vienakalbis tekstynas – 2.4 mln. sakinių. • Lietuvių-anglų lygiagretus tekstynas – 580 tūkst. lygiagrečių sakinių. • Lietuvių-prancūzų lygiagretus tekstynas – 505 tūkst. lygiagrečių sakinių. • Lietuvių-vokiečių lygiagretus tekstynas – 419 tūkst. lygiagrečių sakinių. • Lietuvių-lenkų lygiagretus tekstynas – 455 tūkst. lygiagrečių sakinių. Duomenys pateikiami šiais formatais: TXT (vienakalbiai tekstai) ir TMX (paraleliniai tekstai) Papildomai pateikiami metaduomenys ir statistiniai duomenys. Ištekliai skirti mašininio vertimo sistemų kūrimui ir vertinimui, kalbos modelių mokymui, lingvistiniams ir terminologiniams tyrimams, vertimo atmintims ir CAT įrankiams. Kuriant tekstynus kontroliuotas rašybos klaidų ir užsienietiškų intarpų kiekis vienakalbiuose tekstynuose, bei sakinių lygiavimo tikslumas paraleliniuose tekstynuose.

35
0
0
Publikuota: 2026-04-14 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Bendrasis lietuvių kalbos tekstynas skirtas dirbtinio intelekto poreikiams. Tekstyną sudaro: 25 Parquet formato failai, eilučių (tekstų) skaičius: 8 438 155, žodžių skaičius: 3 941 476 219, failų dydis: 11,7 GB. Tekstynas buvo sudarytas iš 36 skirtingų šaltinių, įskaitant naujienų portalus, teisinius ir administracinius dokumentus, mokslinius leidinius, internetinius tekstus, kalbos transkripcijas ir grožinę literatūrą. Visi šaltiniai buvo įtraukti gavus reikiamus leidimus, licencijas ar remiantis kitais teisėtais naudojimo pagrindais, laikantis galiojančių autorių teisių ir duomenų apsaugos reikalavimų.

81
0
0
Publikuota: 2026-04-14 Atnaujinta: 2026-04-20 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Melagingos informacijos automatinio identifikavimo tekstynas apima lingvistinius resursus, reikalingus kuriant ir vystant dirbtinio intelekto technologijomis grįstus sprendimus, kurie gebėtų automatiškai atpažinti klaidinančią informaciją interneto žiniasklaidos medijų tekstuose. Bendras Tekstyno dydis yra 5 162 anotuoti įrašai. Klaidinančios informacijos lygmens įvertį bendru sutarimu nustatė 2 (du) profesionalūs vertintojai. Metaduomenų kategorijos: straipsnio pavadinimas, straipsnio tekstas, srities žyma, klaidinančios informacijos lygį vertinanti žyma

58
0
0
Publikuota: 2026-04-01 Atnaujinta: 2026-04-07 Valstybės duomenų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Ištirta pirmus metus veiklą vykdančių ūkio subjektų nuomonė apie priežiūros institucijų veiklą, taikomas priežiūros priemones, identifikuoti priežiūros institucijų veiklos ir licencijavimo proceso trūkumai. Tyrimas vykdytas 2025 m.

31
0
0