{"id":207168,"date":"2026-06-18T07:55:15","date_gmt":"2026-06-18T07:55:15","guid":{"rendered":"https:\/\/www.europesays.com\/ee\/207168\/"},"modified":"2026-06-18T07:55:15","modified_gmt":"2026-06-18T07:55:15","slug":"lrec-2026-konverents-naitas-vaikeste-keelte-tulevik-soltub-headest-andmetest","status":"publish","type":"post","link":"https:\/\/www.europesays.com\/ee\/207168\/","title":{"rendered":"LREC 2026 konverents n\u00e4itas: v\u00e4ikeste keelte tulevik s\u00f5ltub headest andmetest"},"content":{"rendered":"<p>Just seet\u00f5ttu oli LREC 2026 oluline ka Eesti vaates. Eesti teadlased ei osalenud konverentsil \u00fcksnes kuulajatena, vaid t\u00f5id rahvusvahelise publiku ette muljetavaldava hulga t\u00f6id, mis aitavad hinnata ja arendada eesti keele kohta k\u00e4ivaid tehisintellekti lahendusi. V\u00e4ikese keele puhul ei ole see k\u00f5rvaline k\u00fcsimus. <\/p>\n<p>Kui inglise keele jaoks leidub andmeid, teste ja t\u00f6\u00f6riistu palju, siis eesti keele jaoks tuleb suur osa neist teadlikult luua: koguda andmeid, teha korpusi, kohandada hindamisviise ja kontrollida, kas mudel saab eesti keelest aru ka siis, kui \u00fclesanne n\u00f5uab grammatikatunnetust, kultuuriteadmisi v\u00f5i arutlemist.<\/p>\n<p>Konverents ise oli mahult muljetavaldav. Esitati 1786 artiklit, millest ettekandmisele j\u00f5udis 944 ehk ligikaudu 52,9%. Kuue p\u00e4eva jooksul toimus k\u00fcmneid suulisi ja postersessioone, t\u00f6\u00f6tube ja \u00f5pitube ning osalejaid oli \u00fcle 2000. <\/p>\n<p>Eesti keele jaoks oli \u00fcks laiap\u00f5hjalisemaid t\u00f6id Helena Grete Lillepalu ja Tanel Alum\u00e4e uurimus \u201eEstonian Native Large Language Model Benchmark\u201c<\/p>\n<p>See n\u00e4itab ilmekalt, kui kiiresti on keeletehnoloogia valdkond laienenud: varasem keeleressursside loomise ja hindamise traditsioon on n\u00fc\u00fcd p\u00f5imunud suurte keelemudelite, multimodaalse tehisintellekti, k\u00f5ne- ja viipekeeletehnoloogia, andme\u00f5iguse ning eetikak\u00fcsimustega.<\/p>\n<p>Eesti keele jaoks oli \u00fcks laiap\u00f5hjalisemaid t\u00f6id Helena Grete Lillepalu ja Tanel Alum\u00e4e uurimus \u201eEstonian Native Large Language Model Benchmark\u201c. Selles esitleti eesti keele v\u00f5rdlustesti, mis koosneb seitsmest alam\u00fclesandest ja katsetati 32 mudelit. <\/p>\n<p>Selliste testide olulisus on lihtsalt m\u00f5istetav: enne kui saame \u00f6elda, et m\u00f5ni keelemudel sobib eesti keeles \u00f5ppimiseks, t\u00f5lkimiseks, avaliku sektori teenustesse v\u00f5i kasutajaga suhtlemiseks, peame teadma, mida ta tegelikult oskab. Kas ta tunneb eesti keele grammatikat? Kas ta saab aru kultuurikontekstist? Kas ta suudab teha kasulikke kokkuv\u00f5tteid? Kas ta vastab usaldusv\u00e4\u00e4rselt ka siis, kui k\u00fcsimus ei ole inglise keele kaudu vahendatud? <\/p>\n<p>Selliste k\u00fcsimustega tegeleb ka hiljuti esmaavaldatud Eesti Keele Instituudi laiap\u00f5hjaline projekt M\u00f5\u00f5dupuu, mille eesm\u00e4rk on selliste testide temaatiline laiendamine ning regulaarselt ja reaalajas uueneva hindamisinfrastruktuuri v\u00e4ljaehitamine.<\/p>\n<p>Mudelite hindamisega tegeles ka Marii Ojastu ja kaasautorite t\u00f6\u00f6 \u201eEstonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation\u201c. <\/p>\n<p>WinoGrande on arutlemisv\u00f5imet hindav andmestik, mis oli algselt loodud inglise keele jaoks. Tartu \u00dclikooli uurimisr\u00fchm t\u00f5lkis ja kohandas selle eesti keelde ning v\u00f5rdles, kuidas mudelid saavad hakkama inimt\u00f5lke ja masint\u00f5lke p\u00f5hjal loodud testidega. Selline t\u00f6\u00f6 aitab vastata v\u00e4ga praktilisele k\u00fcsimusele: kas ingliskeelsete testide t\u00f5lkimisest piisab v\u00f5i on vaja keele- ja kultuuritundlikku kohandamist? <\/p>\n<p>Tulemused n\u00e4itasid, et usaldusv\u00e4\u00e4rseks hindamiseks ei piisa ainult automaatsest t\u00f5lkest ja keelespetsialistide t\u00f6\u00f6 on endiselt oluline.<\/p>\n<p>Hea mudel ei pea ainult ladusat keelt genereerima, vaid olema ka hinnatav, l\u00e4bipaistev ja k\u00e4ituma vastutustundlikult.<\/p>\n<p>Suurte keelemudelite k\u00f5rval oli konverentsil tugevalt esil ka vastutustundliku tehisintellekti teema. Dan Jurafsky plenaarettekanne k\u00e4sitles keelemudelite sotsiaalseid puuduj\u00e4\u00e4ke vestluspartnerina.<\/p>\n<p>Probleem ei ole ainult selles, et mudel v\u00f5ib eksida. Sama oluline on see, kuidas ta eksib: sageli enesekindlalt, kasutajale meeldida p\u00fc\u00fcdes ja vahel ka kasutaja ekslikke v\u00f5i kahjulikke m\u00f5ttek\u00e4ike kinnitades. See on oluline meeldetuletus ka eesti keele tehnoloogia arendamisel. Hea mudel ei pea ainult ladusat keelt genereerima, vaid olema ka hinnatav, l\u00e4bipaistev ja k\u00e4ituma vastutustundlikult.<\/p>\n<p>Vastutustundliku tehisintellekti praktilise hindamisega haakus ka Neha Sharma, Navneet Agarwali ja Kairit Sirtsi t\u00f6\u00f6 \u201eTowards Consistent Detection of Cognitive Distortions: LLM-Based Annotation and Dataset-Agnostic Evaluation\u201c. See k\u00e4sitles kognitiivsete erip\u00e4rade tuvastamist ning suurte keelemudelite kasutamist andmete m\u00e4rgendamisel ja andmestike\u00fclesel hindamisel. <\/p>\n<p>Sellised uurimused on olulised just seep\u00e4rast, et tehisaru liigub j\u00e4rjest rohkem valdkondadesse, kus keeleline v\u00e4ljendus, inimese hoiakud ja v\u00f5imalikud m\u00f5ttemustrid v\u00f5ivad olla tundlikud. Kui mudelit kasutatakse n\u00e4iteks vaimse tervise, n\u00f5ustamise v\u00f5i kasutajatoe kontekstis, ei piisa tehniliselt korrektsest vastusest; vaja on ka t\u00f6\u00f6kindlat arusaama sellest, millal mudel v\u00f5ib kasutaja m\u00f5tteviisi ekslikult kinnitada v\u00f5i liiga enesekindlalt t\u00f5lgendada.<\/p>\n<p>Eesti teadlaste panus ei piirdunud ainult suurte keelemudelite testimisega. Mark Fi\u0161el pidas RESOURCEFUL-2026 t\u00f6\u00f6toas plenaarettekande v\u00e4heste ressurssidega keelte t\u00f5lke- ja keelemudelite arendamise parematest ja halvematest praktikatest. <\/p>\n<p>Jelena Kallas, Ahto Kiil, Heete Sahkai, Geda Paulsen ja Kertu Saul uurisid t\u00f6\u00f6s \u201eUsing LLMs to Extract Instances of Schematic Constructions from Unannotated L2 Learner Corpora\u201c, kuidas kasutada suuri keelemudeleid eesti keele \u00f5ppijakorpustes skemaatiliste konstruktsioonide tuvastamiseks. <\/p>\n<p>Meeri-Ly Muru ja Eduard Barbu t\u00f6\u00f6 \u201eDocument-Level Text Simplification in Estonian Using Large Language Models\u201c k\u00e4sitles aga eestikeelse teksti lihtsustamisv\u00f5imlausi suurte keelemudelite abil. See on hea n\u00e4ide sellest, kuidas suured keelemudelid v\u00f5ivad aidata muuta keerulisi tekste eri kasutajar\u00fchmadele ligip\u00e4\u00e4setavamaks, olgu sihtr\u00fchmaks \u00f5ppijad, ametitekstide lugejad v\u00f5i inimesed, kelle jaoks tavap\u00e4rane erialakeel on liiga keeruline.<\/p>\n<p>Eesti jaoks on s\u00f5num selge: kui tahame, et tehisintellekt oskaks eesti keelt usaldusv\u00e4\u00e4rselt, peame ise looma andmestikke, hindamisvahendeid ja teadmist selle kohta, mis teeb eesti keele masinale keeruliseks.<\/p>\n<p>Karl Gustav Gailit tutvustas eesti keele subjektiivsuskorpust ning inim- ja masinhindamise v\u00f5rdlust. Heiki-Jaan Kaalep esitles l\u00e4henemist, millega ajalooline \u201eAsutawa Kogu\u201c korpus teisendati kaasaegsema kirjaviisi poole. Tartu \u00dclikooli teadlased panustasid ka teadmusgraafide loomise ja hindamise teemadesse, sealhulgas t\u00f6\u00f6dega \u201eReX-GG: A LLM Ensemble Pipeline for Relation-extraction and Graph Generation\u201c ning \u201eLarge Language Models for Knowledge Graph Extraction: A Schema-Constrained Evaluation Framework\u201c. <\/p>\n<p>Need t\u00f6\u00f6d n\u00e4itavad, et Eesti teadlaste huvi ei piirdu \u00fche tehnoloogilise moesuunaga, vaid ulatub \u00f5ppijakeelest ja tekstide lihtsustamisest ajaloolise kirjakeele, teadmuse esitamise ja mudelite usaldusv\u00e4\u00e4rsuse hindamiseni.<\/p>\n<p>LREC 2026 \u00fcldpilt kinnitas, et keeletehnoloogia ei ole enam ainult tekstide t\u00f6\u00f6tlemise ja keeleressursside tehniline valdkond. See on koht, kus saavad kokku andmed, keel, tehisintellekt, \u00f5igus, eetika, ettev\u00f5tlus ja \u00fchiskondlik vastutus. Eesti jaoks on s\u00f5num selge: kui tahame, et tehisintellekt oskaks eesti keelt usaldusv\u00e4\u00e4rselt, peame ise looma andmestikke, hindamisvahendeid ja teadmist selle kohta, mis teeb eesti keele masinale keeruliseks.<\/p>\n<p>Eesti teadlaste n\u00e4htav osalus LREC 2026-l n\u00e4itab, et seda t\u00f6\u00f6d juba tehakse. Ja mitte ainult eesti keele kaitseks, vaid panustades rahvusvahelise keeletehnoloogia arengusse: v\u00e4ikeste keelte probleemid sunnivad looma t\u00e4psemaid, \u00f5iglasemaid ja paremini hinnatavaid tehisintellekti lahendusi k\u00f5igile.<\/p>\n","protected":false},"excerpt":{"rendered":"Just seet\u00f5ttu oli LREC 2026 oluline ka Eesti vaates. Eesti teadlased ei osalenud konverentsil \u00fcksnes kuulajatena, vaid t\u00f5id&hellip;\n","protected":false},"author":2,"featured_media":207169,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","_share_on_mastodon":"0"},"categories":[14],"tags":[74312,375,3312,131,378,2881,679,74313,130,2206,37,33,35,635,2717,34,36,25590,49066,1602,57441,45893,74311,74310,6007,11018,14307,11393,46207,373,28124,3155,387,74314,1999,5282,19593],"class_list":["post-207168","post","type-post","status-publish","format-standard","has-post-thumbnail","category-ari","tag-adblue","tag-ai","tag-apple","tag-ari","tag-auto","tag-autojuht","tag-autoleht","tag-autotund","tag-business","tag-chatgpt","tag-ee","tag-eesti","tag-eesti-keel","tag-elektriauto","tag-elisa","tag-estonia","tag-estonian","tag-hubriidauto","tag-jaarada","tag-liiklus","tag-operatsioonisusteem","tag-pistikhubriid","tag-rehv","tag-rehvitakso","tag-samsung","tag-smart-id","tag-soiduk","tag-starlink","tag-sulearvuti","tag-tehisintellekt","tag-tehnoulevaatus","tag-tele2","tag-telefon","tag-telefoninumbri-otsing","tag-telia","tag-valguskaabel","tag-xiaomi"],"share_on_mastodon":{"url":"https:\/\/pubeurope.com\/@ee\/116770041057417591","error":""},"_links":{"self":[{"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/posts\/207168","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/comments?post=207168"}],"version-history":[{"count":0,"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/posts\/207168\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/media\/207169"}],"wp:attachment":[{"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/media?parent=207168"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/categories?post=207168"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.europesays.com\/ee\/wp-json\/wp\/v2\/tags?post=207168"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}