Голос из тишины: как ИИ воскрешает мёртвые языки и создаёт новые

Голос из тишины: как ИИ воскрешает мёртвые языки и создаёт новые

Айгерім Бәбіш
Фото: ©️El.kz / ИИ (ChatGPT)

Искусственный интеллект всё увереннее работает там, где раньше требовались годы ручного труда: он ищет родство между древними словами, предлагает варианты утраченных фрагментов и помогает учёным датировать надписи. А новейшие системы уже двигаются в обратную сторону — не ищут язык прошлого, а создают новый с нуля, со своей фонетикой, грамматикой и словарём. Подробнее в материале El.kz.

Летом 2026 года исследователи представили ConlangCrafter — инструмент для автоматического конструирования языков. Звучит почти фантастически: пока одни алгоритмы пытаются вернуть голос цивилизациям, от которых остались лишь обломки табличек, другие сочиняют речь для ещё не существующих народов. 

Что именно означает «воскресить язык»

Мёртвым обычно называют язык, который больше не усваивается детьми как родной. У него при этом могут оставаться тексты, словари, грамматики и даже люди, умеющие его читать. Латынь — классический пример: носителей в бытовом смысле нет, но язык хорошо документирован и продолжает использоваться в отдельных сферах. Исчезнувший язык — более трудный случай: последний носитель умер, а материалов может быть слишком мало, чтобы восстановить произношение и правила. Наконец, существует нерасшифрованная письменность: знаки видны, но неизвестно, какой язык за ними стоит и как их читать.

©️El.kz / ИИ (ChatGPT)

Поэтому ИИ может выполнять сразу несколько разных задач. Он распознаёт плохо видимые символы, собирает разрозненные записи в цифровой корпус, сопоставляет слова с родственными языками, предлагает пропуски в повреждённом тексте и создаёт учебные материалы. Но вернуть язык в повседневную жизнь может только сообщество: люди должны говорить на нём дома, учить детей, придумывать современные слова, шутить и спорить. Алгоритм способен подготовить инструменты, но не создать носителей.

Нейросеть ищет законы в родственных словах

Один из наиболее известных экспериментов с автоматической дешифровкой провели Джиаминг Ло, Юань Цао и Регина Барзилай. Их система NeuroCipher опиралась на закономерности исторического изменения звуков. Если два языка родственны, похожие звуки переходят друг в друга не хаотично, а достаточно регулярно. Модель училась замечать такие соответствия на уровне знаков и находить когнаты — слова общего происхождения.

Метод проверяли на угаритском языке и линейном письме Б, используя в качестве ориентиров иврит и древнегреческий. В задаче с линейным письмом Б алгоритм правильно сопоставил 67,3% родственных слов. Это важный результат, но не волшебная дешифровка неизвестного текста: оба случая уже изучены, поэтому исследователи могли проверить ответ. Главная ценность эксперимента — доказательство того, что машина способна воспроизвести часть логики сравнительно-исторического языкознания и быстро перебрать больше гипотез, чем человек.

Ithaca и Aeneas: когда пропуски начинают говорить

Другая линия исследований работает не с полностью неизвестным языком, а с повреждёнными текстами. В 2022 году в Nature была представлена система Ithaca для древнегреческих надписей. Она предлагает варианты недостающих символов, определяет вероятный регион происхождения и помогает датировать текст. В тестах Ithaca самостоятельно восстанавливала фрагменты с точностью 62%. Историки без подсказки модели справлялись с заданием в 25% случаев, а при совместной работе с ней — в 72%.

©️El.kz / ИИ (GROK)

В 2025 году та же исследовательская группа описала Aeneas — мультимодальную модель для латинских надписей. Она анализирует не только расшифровку текста, но и изображение камня, ищет исторические параллели и умеет предлагать фрагменты произвольной длины. Такие системы не «переводят голос Древнего Рима» без ошибок. Они ранжируют вероятные версии и показывают специалисту, с какими текстами их стоит сравнить. Последнее слово остаётся за эпиграфистом, потому что одна буква может изменить имя, дату или смысл документа.

От текста к голосу

Когда записи собраны и правила частично реконструированы, ИИ может помочь сделать язык доступнее. Оптическое распознавание превращает фотографии рукописей в поисковый текст; языковые модели помогают размечать формы слов и составлять черновики словарей; распознавание речи сохраняет рассказы последних носителей; синтез речи позволяет создавать озвученные уроки. Для языка с малым количеством данных особенно полезен перенос знаний: модель обучается на хорошо документированных языках, а затем адаптируется на небольшом корпусе редкого.

Но синтезированный голос — это реконструкция, а не аудиозапись предков. У древнего языка могли быть диалекты и интонации, которые не попали в письменные источники. Даже если нейросеть звучит убедительно, она лишь выбирает произношение, совместимое с принятой научной гипотезой. Поэтому такие записи должны маркироваться как модельные, иначе удобная учебная версия быстро начнёт восприниматься как единственно верная.

Языки, которых вчера не существовало

Если при работе с древними текстами машина движется от следов к гипотезе, то ConlangCrafter идёт в противоположную сторону — от замысла к полноценному языковому эскизу. Система, представленная в материалах конференции ACL 2026, разбивает задачу на этапы: сначала создаёт фонологию, затем морфологию и синтаксис, после этого словарь и примеры перевода. На каждом шаге модель проверяет собственные решения и пытается исправить противоречия.

©️El.kz / ИИ (GROK)

В основном эксперименте авторы получили примерно по 20 языков с помощью трёх базовых моделей — Gemini 2.5 Flash, Gemini 2.5 Pro и DeepSeek-R1, то есть свыше 60 вариантов. Два лингвиста уровня PhD отдельно проверяли часть результатов; на экспертную оценку ушло около 35 часов. Исследователи сравнивали языки по типологическим признакам: порядку слов, наличию тонов, системе падежей и другим параметрам. ConlangCrafter оказался разнообразнее простой генерации всего языка одним запросом, хотя полностью последовательные переводы всё ещё остаются трудной задачей.

Пользователь может задать необычное условие. Как пример в статье приведены язык без согласных и система общения для разумных головоногих, где вместо звуков используются цвета и жесты щупалец. Практическая ниша очевидна: кино, игры, литература и создание вымышленных миров. Раньше автору требовалась команда лингвистов, чтобы придуманный народ говорил последовательно, а не набором красивых слогов. Теперь ИИ может быстро подготовить основу, которую специалист доработает под историю и культуру персонажей.

Почему придуманный язык ещё не становится живым

Язык — не только таблица звуков и набор правил. В нём есть скрытые значения, вежливость, юмор, табу, диалекты и память о событиях. Люди постоянно нарушают нормы, сокращают слова и меняют смысл выражений. Созданная нейросетью грамматика может быть стройной, но она не имеет собственной истории и среды. Чтобы искусственный язык стал живым, его должны присвоить себе говорящие: начать использовать, договариваться о нормах и передавать другим. У ConlangCrafter есть и технические ограничения. Авторы признают, что большие модели могут тяготеть к английскому и другим хорошо представленным языкам. Краткое описание охватывает фонологию, базовую грамматику и лексику, но почти не передаёт прагматику, дискурс, культурные ассоциации и полноценную письменность. Получается убедительный каркас, а не готовая цивилизация.

Опасность красивой ошибки

Чем увереннее звучит ответ нейросети, тем легче забыть, что перед нами вероятностная версия. Если сохранилось мало табличек, у модели будет много равноправных объяснений. Она также способна достроить пропуск привычной формулой и не заметить редкое имя или исключение. При плохой проверке гипотеза превращается в «факт», попадает в словарь, а затем возвращается в новые модели как обучающий материал. Поэтому важны открытые данные, указание степени уверенности и возможность увидеть альтернативы, а не только один гладкий перевод.

Не машина времени, а новый собеседник историка

ИИ не отменяет столетия лингвистической работы и не гарантирует, что древняя фраза зазвучит именно так, как её произносили две тысячи лет назад. Его сила в другом: он объединяет огромные корпуса, замечает повторяющиеся закономерности, быстро предлагает проверяемые версии и делает редкий язык видимым в цифровой среде. Там, где материалов достаточно, это ускоряет исследование; там, где их почти нет, алгоритм честно должен оставаться генератором гипотез.

©️El.kz / ИИ (GROK)

Парадокс новой эпохи в том, что одна и та же технология работает на двух концах языковой истории. Она помогает читать слова людей, давно исчезнувших, и одновременно даёт форму речи существам, которых никогда не было. Но настоящий язык начинается не в вычислительном центре. Он начинается в тот момент, когда кто-то обращается на нём к другому человеку — и получает ответ.

Ранее мы писали о пяти самых необычных блюд мира.

El рекомендует

{