Инициативата беше представена от Анар Курманжанкъзъ, ръководител на съвместен проект между Международното общество „Казак Тили“ и „ОупънЕйАй“.
Пакетът за бенчмарк за оценка на ИИ оценява големи езикови модели в области, включително разбиране, граматика, естественост на казахската реч, пословици и идиоми, академичен превод, литературен превод от казахски на английски, превод на детска литература и етнографски знания. Той е разработен на казахски от самото начало, като се вземат предвид езиковите и културните характеристики на казахския език.
Отделен етнографски бенчмарк включва 500 въпроса, обхващащи историята, традициите и културата на казахстанския народ.
Планира се бенчмаркът да бъде предоставен на академичната общност и да се използва за оценка на други езикови модели.
Проектът има за цел също така да помогне за запазването на историческото наследство на Казахстан. Изследователите разработват инструменти с изкуствен интелект, базирани на технология за оптично разпознаване на символи, за да дигитализират архивни материали и учебници на казахски език. Технологията може да разпознава текст на казахски език във вестници, книги и документи, да идентифицира структури на страници и точно да извлича текст, включително от страници с много колони.
„Разработчиците също така събират текстови и аудио данни на казахски език за обучение на изкуствен интелект. Аудио наборът от данни в момента включва 12 000 часа записи, всички почистени от фонов шум, музика и други странични звуци. Транскрипционните модели, адаптирани към казахски език, са довели точността на преобразуването на реч в текст до 98%“, заяви Курманжанкъзъ.
По-рано беше съобщено, че специалисти са съставили база данни от 14 милиарда токена, за да подобрят отговорите на Чат Джи Пи Ти на казахски език. Съдържа материали от различни периоди от развитието на езика, обхващащи историята, културата, образованието и науката, както и езиковото наследство на казахстанската диаспора в чужбина.
(Тази информация се разпространява по споразумение между БТА и Казинформ)