Magyar nyelvű érvelő modell
Továbbra is komoly kihívást jelent a magyar nyelv és a magyar kultúra a globális nyelvi modellek számára. Mindez elsősorban arra vezethető vissza, hogy anyanyelvünk morfológiailag rendkívül gazdag. Szavaink sok ragot, jelet, képzőt hordoznak, így aztán egyetlen szóalakban rengeteg információ sűrűsödhet össze. Ezért is kiemelkedően fontos a saját adatokon tanított technológia. Az ELTE Informatikai Kar (IK) Mesterséges Intelligencia Tanszékének kutatói – a Digitális Örökség Nemzeti Laboratóriummal együttműködve – először tanítottak magyarra nagy érvelő nyelvi modellt.
Kép: ELTE IKA Mesterséges Intelligencia Tanszék mérnökökből és nyelvtechnológusokból álló kilencfős csapata a költséghatékony tanítás során körülbelül 200 millió oldalnak megfelelő szöveget dolgozott fel a magyar akadémiai közösség számára elérhető Komondor HPC infrastruktúrán, hazánk legnagyobb szuperszámítógépén. A modellt végül összesen 160 milliárd tokennyi adaton, azaz apró egységen tanították. Munkájuk eredményeként a Racka–4B modell teljesítménye a magyar nyelvi feladatokban a kétszer akkora (8 milliárd paraméteres) modellek teljesítményével is összemérhetővé vált, sebessége pedig jócskán meghaladta azokét.
A modell magyarítása több párhuzamos technológiai lépésben történt, melyek közül az egyik legfontosabb a mesterséges intelligencia „szótárának” optimalizálása volt. Jóllehet a fókusz a magyar nyelvre irányult, az adathalmaznak csak a 44 százalékát tette ki a hazai szöveg, a maradék angol (24 százalék), német (21 százalék), illetve programkód (11 százalék) volt; ez utóbbi az alapmodell logikai és érvelési (reasoning) képességeinek megtartása miatt volt kulcsfontosságú.•
Címlapkép: ELTE IK


