Sėkmingai užbaigtas tarpinstitucinis projektas

2024 m. gruodžio–2026 m. balandžio mėnesiais Valstybės skaitmeninių sprendimų agentūra (VSSA) vykdė projektą Bendrojo lietuvių kalbos tekstyno ir vektorizuotų lietuvių kalbos modelių sukūrimas (projekto kodas: 02-103-P-0001), kuriame VDU Skaitmeninių išteklių ir tarpdisciplininlių tyrimų instituto tyrėjai kartu su verslo partneriais – UAB „Neurotechnology“, UAB „Tilde IT“ ir MB „Krilas“ – kūrė Lietuvai reikšmingus dirbtinio intelekto sprendimus.

VSSA projekto vadovas A. Rakauskas. Tiekėjų grupės vadovas doc. dr. A. Utka.

Projekto rezultatai:

Bendrasis lietuvių kalbos tekstynas (BLKT) – sudarytas iš originalių žmogaus sukurtų tekstų, tekstyno apimtis –  3,9 mlrd. žodžių, o tekstų tipai apima žiniasklaidos tekstus (52.28%), dokumentus (38.29%), negrožinius tekstus (7.08%), sakytinės kalbos tekstus (2.04%), grožinius tekstus (0.30%).

Mažasis lietuvių kalbos vektorizuotas modelis (LT-MLKM-modernBERT) – tai maskuotosios kalbos tipo neuroninis lietuvių kalbos modelis, apmokytas su 1,87 mlrd. žodžių iš BLKT tekstyno. Šis modelis prieinamas Hugging Face platformoje adresu: https://huggingface.co/VSSA-SDSA/LT-MLKM-modernBERT.

Didysis lietuvių kalbos vektorizuotas modelis (DLKVM) – sukurtas naudojant „Llama 3“ architektūros principus ir apmokytas su 3,9 mlrd. žodžių iš BLKT tekstyno. Šis modelis prieinamas Hugging Face platformoje adresu: https://huggingface.co/datasets/VSSA-SDSA/LT_AI_DLKVM.

Kviečiame skaityti Vytauto Didžiojo universiteto (VDU) tinklalapyje paskelbtą straipsnį „VDU vadovaujamas konsorciumas sukūrė lietuvių kalbos tekstyną ir du dirbtinio intelekto modelius“, kuriame išsamiai paaiškinama modelių paskirtis ir naudojimo galimybės, supažindinama su modelių kūrimo subtilybėmis, atskleidžiama projekto svarba Lietuvai, o taip pat pateikiamas prie projekto dirbusių partnerių indėlis.

Projektu Bendrojo lietuvių kalbos tekstyno ir vektorizuotų lietuvių kalbos modelių sukūrimas siekiama skatinti Lietuvos skaitmeninę transformaciją ir prisidėti prie 2021–2030 metų Lietuvos Respublikos valstybės skaitmeninimo plėtros programos pažangos priemone Nr. 05-002-01-07-08 „Kurti technologinius sprendimus ir įrankius, leidžiančius saugiai ir patogiai naudotis paslaugomis“ veiklos „Kalbinių išteklių dirbtinio intelekto technologijų sprendimų poreikiams plėtra“ įgyvendinimo.

Daugiau informacijos apie šį projektą rasite:

CLARIN-LT saugykloje https://clarin-repo.lt/server/api/core/bitstreams/a2073e11-9c22-4aca-bfee-b2c60954f2a6/content

VDU SITTI instituto tinklalapyje https://sitti.vdu.lt/bendrasis-lietuviu-kalbos-tekstynas-ir-vektorizuoti-modeliai/

VSSA tinklalapyje https://vssa.lrv.lt/lt/apie-vssa/projektai/bendrojo-lietuviu-kalbos-tekstyno-ir-vektorizuotu-modeliu-sukurimas/

Sekite CLARIN-LT naujienas mūsų Facebook paskyroje ir interneto tinklalapyje.

Skelbta Uncategorized

Parašykite komentarą

Archyvai