2026 m. liepos mėnesį dėl IT infrastruktūros atnaujinimo darbų laikinai nebus atnaujinama dalis Valstybės duomenų agentūros skelbiamų duomenų rinkinių atvirų duomenų portale. Daugiau skaitykite https://data.gov.lt/blog/2026/07/03/2026-m-liepos-m%C4%97n-duomen%C5%B3-rinkini%C5%B3-atnaujinimo-tvarka/

Rasta duomenų išteklių: 1
Publikuota: 2026-03-31 Atnaujinta: 2026-06-03 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Lietuvių vienakalbis, anglų vienakalbis ir anglų–lietuvių lygiagretusis medicinos tekstynai apima originalius lietuvių ir anglų kalbų tekstus, o lygiagrečiojo tekstyno atveju – ir jų vertimus į lietuvių kalbą, suderintus sakinio lygiu. Tekstai surinkti iš Europos Sąjungos ir Lietuvos institucijų dokumentų, mokslinių publikacijų, teisės aktų bei kitų su medicina ir sveikatos apsauga susijusių šaltinių. Bendras tekstynų dydis: Lietuvių vienakalbis – 13 mln. žodžių. Anglų vienakalbis – 12,1 mln. žodžių. Anglų–lietuvių lygiagretusis – 230 tūkstančių sakinių porų. Tekstynai apima pagrindines medicinos sritis, įskaitant bazines medicinos paslaugas, farmakologiją ir farmacijos mokslus, klinikinę mediciną, psichiatriją ir psichologiją bei visuomenės sveikatą, epidemiologiją ir ligų prevenciją, užtikrinant teminį reprezentatyvumą. Duomenų rinkinio struktūra: 1. Medical Data Metadata.xlsx – metaduomenų dokumentas. 2. Medical Data Statistics.xlsx– statistinė informacija apie duomenis, įskaitant kokybės rodiklius (pvz., gramatinių klaidų, užsienio kalbų intarpų kiekį ir kt.). 3. Katalogas „Monolingual“ – lietuvių ir anglų kalbų vienakalbiai tekstynai TXT formatu. 4. Katalogas „Parallel“ – lygiagretusis tekstynas TMX formatu. 5. Katalogas „Subdomains“ – tekstynai suskirstyti pagal medicinos sritis (domenus). Duomenų rinkinio failai parengti taip, kad būtų tinkami naudoti mašininio vertimo, lokalizavimo ir kituose dirbtinio intelekto taikymuose.

47
0
0