3 Августа, 09:03
Тургай сегодня: статуя Свободы, дюны и дух Алаш-ордыНейросеть может уверенно писать по-казахски и тут же перепутать окончание, название аула или смысл обычая. Почему язык миллионов людей остаётся сложным для ИИ, сообщает El.kz.
В основу материала вошли исследования казахоязычных моделей, открытых языковых корпусов и систем проверки ИИ. Они показывают, что связная речь ещё не гарантирует точности: модель может правильно построить фразу и ошибиться в местном факте, культурном контексте или намерении пользователя.
Нейросеть видит язык как данные
Большая языковая модель подбирает продолжение текста по закономерностям, найденным во время обучения. Она не понимает слово так, как его понимает человек с жизненным опытом. Гладкая формулировка говорит о способности воспроизводить языковой шаблон, однако не подтверждает достоверность ответа.
Универсальные модели обучают сразу на многих языках. Основной объём доступного материала обычно приходится на английский и другие языки с большим цифровым присутствием. Когда казахских примеров заметно меньше, система чаще переносит знакомые конструкции из русского или английского, создаёт кальки и хуже удерживает окончания.
В случае Казахстана модель решает две разные задачи. Первая связана с грамматикой, словарём и построением фразы. Вторая требует знания истории страны, её учреждений, географии и повседневных реалий, поэтому успех в одной области ничего не гарантирует в другой.
Миллионы носителей не гарантируют цифрового равенства
В компьютерной лингвистике казахский относят к языкам с ограниченными цифровыми ресурсами. Термин описывает объём доступных корпусов, словарей, аудиозаписей и размеченных примеров. Он ничего не говорит о богатстве языка, числе его функций или значении для общества.
Разговоры дома, бумажные книги и документы в архиве сами по себе в обучающий набор не попадают. Разработчикам нужен материал в машиночитаемом формате, с понятным происхождением и правом на использование. После сбора текст приходится очищать, приводить к единой кодировке и проверять.
Открытая часть интернета тоже отражает язык неравномерно. В ней легче найти новости, официальные документы и переводы, чем естественные диалоги между людьми. Региональная лексика, бытовая речь, юмор и новые выражения остаются представлены слабее, поэтому модель хуже справляется с ними.
Объём корпуса ещё не решает проблему
Сырые данные из интернета содержат повторы, устаревшие страницы, опечатки и машинные переводы. Если ошибочная конструкция встречается много раз, алгоритм тоже воспринимает её как закономерность. Синтетические тексты помогают расширить корпус, хотя способны закрепить порядок слов и речевые обороты исходного языка. После публикации такой материал может снова попасть в обучающие данные, из-за чего одна машинная ошибка начинает воспроизводить другую.
Для разных задач требуется отдельная разметка. Переводчику нужны параллельные фразы, поисковой системе – связи между вопросом и подходящим документом, а модератору – примеры оскорблений с учётом контекста. Такую работу выполняют носители языка и профильные специалисты, иначе формально крупный набор охватит слишком мало речевых явлений.
Простое наращивание массива данных зависит и от соблюдения прав людей. Книги охраняются авторским правом, переписка содержит личные сведения, а запись голоса позволяет идентифицировать человека. Полезный корпус требует прозрачного происхождения материалов, согласия участников и правил дальнейшего использования.
Почему казахское слово распадается на части
Казахский относится к агглютинативным языкам: грамматические значения последовательно добавляются к основе с помощью аффиксов. Формы “үй”, “үйде” и “үйлерімізден” связаны одним корнем, но передают разные отношения. Для человека эта связь естественна, универсальный алгоритм может увидеть несколько слабо связанных последовательностей символов.
Перед обработкой модель делит текст на токены – целые слова или их фрагменты. Универсальный токенизатор лучше приспособлен к частым сочетаниям из языков, которые преобладали при обучении. Для казахской фразы в таком случае требуется больше токенов, обработка расходует больше вычислительных ресурсов, а связь между корнем и аффиксами становится менее заметной.
Авторы проекта SozKZ создали отдельный токенизатор для казахского языка. По их предварительным результатам, он делит казахские слова на фрагменты в два-три раза экономнее универсальных решений. Работа пока опубликована как препринт, но хорошо показывает, почему устройство токенизатора влияет на качество даже при сравнительно небольшой модели.
Два языка в одной фразе
Для Казахстана характерно переключение между казахским и русским внутри разговора. Человек может вставить русское существительное в казахскую фразу, присоединить к нему казахское окончание или сменить язык после нескольких слов. Алгоритму приходится одновременно определить границы языков, восстановить грамматику и понять общее намерение.
Исследователи из Казахстана и России представили первый параллельный корпус для машинного перевода смешанной казахско-русской речи. В нём было лишь 600 предложений. Набор подходил только для проверки и был слишком мал для полноценного обучения, что показывает дефицит подготовленных данных для распространённой речевой практики.
Дополнительную сложность создают варианты письма. Современный текст обычно набран кириллицей, пользователи соцсетей применяют собственную латинскую транслитерацию, а часть исторического наследия записана арабской графикой. Если слово “қазақ” набрать как “казак”, модель получит другую последовательность символов и столкнётся с языковой неоднозначностью. Имя или термин в нескольких написаниях тоже превращается для алгоритма в разные последовательности, хотя человек узнаёт один и тот же объект.
Когда текст спрятан на изображении
Большая часть языковых моделей работает с уже распознанным текстом. Страница старой книги, фотография вывески или архивная рукопись сначала должна пройти через систему оптического распознавания. Ошибка на этом этапе меняет буквы и слова ещё до того, как к содержанию обратится переводчик или чат-бот.
В свежем исследовании по казахскому OCR авторы указали на нехватку тестовых материалов для латинской и арабской графики. Они создали синтетический набор из 7 219 изображений и проверили мультимодальные модели. Системы плохо читали казахский текст на этих двух графиках, а арабское письмо принимали за другие языки.
Из-за этого часть казахского письменного наследия остаётся труднодоступной для нейросетей даже при наличии цифровых копий. Отсканировать книгу недостаточно: страницы нужно распознать, сверить с оригиналом и снабдить сведениями о времени, авторе и системе письма. Иначе модель получает искажённый текст без исторического контекста.
Голос требует отдельного обучения
Работа с письменным запросом мало говорит о качестве голосового помощника. Система распознавания речи должна справляться с темпом, паузами, особенностями произношения и посторонним шумом. Запись диктора в студии заметно отличается от сообщения из автомобиля, подъезда или оживлённой улицы.
Открытые ресурсы для казахской речи постепенно появляются. Один из краудсорсинговых корпусов собрал около 330 часов аудио, записанного большой группой участников. Однако общая продолжительность остаётся лишь одной характеристикой: нужны разные регионы, возрастные группы, устройства и естественные случаи смешения языков.
Корпус KazakhTTS2 расширил набор голосов и тематик для синтеза казахской речи. Такие проекты помогают создавать более естественное озвучивание, хотя фиксированный набор чтецов не способен передать всё разнообразие повседневной речи. Поэтому система может хорошо читать новость и хуже разбирать спонтанную реплику пользователя.
Говорить по-казахски и знать Казахстан – разные задачи
Модель способна построить грамматически приемлемый ответ за счёт языковых закономерностей и одновременно выдумать факт. Особенно уязвимы сведения, которые редко встречаются в больших международных корпусах. Часть информации о Казахстане система усваивает из русскоязычных и англоязычных источников, а затем переводит готовую конструкцию на казахский. В результате ответ может сохранять кальки, чужой порядок слов и неточную передачу местного понятия.
Для отдельной проверки культурных знаний исследователи создали KazBench-KK. В набор вошло более семи тысяч вопросов о казахском обществе и культурном контексте. Авторы обнаружили, что специализированная доработка иногда позволяет небольшой модели соперничать с более крупной системой в узкой местной теме.
У такого теста есть границы. Он использует вопросы с вариантами ответа и не измеряет качество длинного текста, свободного диалога или смешанной речи. Сами разработчики также признают, что некоторые региональные культурные явления представлены в наборе слабее остальных.
Что показали проверки нейросетей
Один из самых крупных местных тестов получил название KazMMLU. Он включает 23 тысячи вопросов, взятых из казахстанских учебных материалов и проверенных носителями языка и преподавателями. Темы охватывают школьные и университетские знания, включая содержание, связанное с Казахстаном.
Авторы проверили модели компаний OpenAI, DeepSeek, Meta и Alibaba. Даже лучшие из рассмотренных систем сохраняли заметный запас для улучшения при ответах на казахском и русском языках. Исследователи связали результат с недостаточным представлением языка и региональных знаний в системах обработки текста.
Бенчмарк фиксирует состояние конкретных версий моделей и не описывает качество будущих обновлений. Сервисы меняются, а результат зависит от формулировки запроса и метода оценки. Такие проверки позволяют измерять проблему на местном материале, а заявления разработчиков – сопоставлять с воспроизводимыми результатами.
Где языковой разрыв становится риском
В развлекательном диалоге странная фраза чаще вызывает раздражение. В образовательном сервисе такая же ошибка способна закрепить неверное правило или исторический факт. В банковском и государственном чат-боте от качества языка уже зависит, поймёт ли человек условие услуги и сможет ли правильно сформулировать обращение.
Разница проявляется и в защитных механизмах. Авторы набора Qorgau сравнили ответы двенадцати моделей на рискованные запросы в казахско-русском контексте. На русском безопасные ответы протестированных систем чаще содержали более подробные и разнообразные пояснения, чем на казахском, хотя результат заметно различался от модели к модели.
Похожий риск возникает при автоматической модерации. Система с бедным знанием контекста может пропустить угрозу, неправильно истолковать иронию или принять безобидное выражение за нарушение. Когда казахоязычному пользователю приходится переходить на русский ради более точного ответа, цифровая услуга фактически работает для двух аудиторий с разным качеством.
Казахстан уже обучает свои модели
Институт умных систем и искусственного интеллекта Назарбаев Университета выпустил ISSAI KAZ-LLM. По данным разработчиков, обучающий массив превысил 150 миллиардов токенов на казахском, русском, английском и турецком языках. В него вошли открытые сайты, новости и электронные библиотеки, а часть англоязычных материалов перевели на казахский.
Позже появились Sherkala и AlemLLM. Sherkala получила расширенный словарь токенизатора и настройку на казахстанских инструкциях, а AlemLLM открыли для разработчиков казахоязычных сервисов. Официальные источники сейчас называют KazLLM и AlemLLM среди отечественных больших языковых моделей.
Вместе с крупными проектами развиваются компактные модели, переводчики, речевые корпуса и местные бенчмарки. Специализация помогает расходовать вычислительные ресурсы эффективнее и улучшать отдельные задачи. При этом слово “национальная” в названии не заменяет независимую проверку на живой речи, свежих фактах и сложных запросах.
Что должно измениться
Моделям нужны тексты, созданные носителями казахского языка в разных ситуациях. Корпус должен включать естественную переписку с согласия авторов, профессиональную лексику, региональные слова и разговорные конструкции. Синтетические материалы нужно маркировать и отделять от текстов, написанных человеком, а для голосовых систем собирать разные варианты произношения и условия записи.
Отдельное условие связано с проверкой. Модели следует регулярно тестировать на обновлённых заданиях по праву, медицине, образованию и государственным услугам, привлекая специалистов соответствующей сферы. Публикация методики и состава теста позволит понять, где разработка действительно стала точнее, а где результат вырос благодаря знакомым вопросам.
Для сведений, которые быстро меняются, одной языковой модели мало. Практическому сервису нужен поиск по актуальной базе документов с указанием источника и даты. Исправления пользователей должны разбирать редакторы, лингвисты и отраслевые специалисты, чтобы одни и те же ошибки не возвращались в следующие версии системы.
Как пользоваться ИИ уже сейчас
Запрос лучше писать полным предложением и сразу указывать контекст Казахстана. Полезно назвать аудиторию, желаемый стиль казахского языка и смысл термина, если у него есть несколько толкований. При смешанной речи можно попросить модель сначала привести запрос к литературной форме, затем ответить по существу.
Имена, даты, нормы закона и медицинские советы требуют сверки с первичным источником. Ссылка в ответе тоже нуждается в проверке: нейросети способны выдумывать названия документов, авторов и интернет-адреса. Для свежей информации следует попросить точную дату публикации и открыть сам документ.
Если ответы на казахском и русском расходятся по фактам, языковая версия не определяет, какой вариант верен. Нужно найти официальный документ, исследование или оригинальную цитату и сопоставить их с ответом модели. Сообщение об ошибке разработчику помогает пополнять примеры реального употребления, на которых будут проверяться следующие версии сервиса.
Цифровой след и уголовная ответственность: что взрослые выкладывают в сеть без согласия детей и чем это грозит.
3 Августа, 09:03
Тургай сегодня: статуя Свободы, дюны и дух Алаш-орды27 Июля, 09:05
Музей Алтынсарина в Костанае: 13 тысяч экспонатов и рукопись, которую казахи читали 140 лет назад24 Июля, 14:49
60 тонн золота, рубины и алмазы: что скрывает знаменитый золотой храм Азии16 Июля, 17:07
Деревья ледникового периода сохранились в Казахстане: где они растут