Исследователи из Гарварда и MIT представили MatrAIx, инфраструктуру для тестирования цифровых продуктов с помощью виртуальных пользователей. В ее основе лежит база Persona 8B с 8,3 млрд записей, описывающих разные сочетания человеческих характеристик, сообщает El.kz со ссылкой на исследование, опубликованное на arXiv.
Как устроено виртуальное население
Persona 8B содержит 8,3 млрд записей, созданных на основе статистических данных и нескольких источников информации о людях. Авторы подчеркивают, что система не предназначена для восстановления конкретных людей, она моделирует разнообразие человеческих характеристик и поведения.
Каждая персона описывается с помощью 1 290 категориальных параметров. Они охватывают возраст, регион, образование, профессию, психологические характеристики, навыки, привычки, интересы, отношение к риску и особенности взаимодействия с технологиями.
Часть профилей создается синтетически на основе статистических зависимостей между характеристиками. Другая часть сформирована из обезличенной информации, полученной из биографий, отзывов, социальных исследований и добровольных анкет.
Что умеют ИИ-персоны
MatrAIx позволяет использовать виртуальных пользователей в четырех средах. Они могут проходить опросы, взаимодействовать с чат-ботами, посещать сайты и работать с приложениями.
Исследователи могут задать целевую аудиторию и сценарий, после чего выбранные персоны получают задачу. Система фиксирует их действия, продолжительность выполнения, результат и реакцию на происходящее.
Потенциально такой подход позволяет тестировать цифровые продукты до их запуска. Например, исследователи могут проверить реакцию разных групп на изменение цены, выяснить, насколько удобно пользоваться функцией приложения или посмотреть, продолжит ли пользователь общение с чат-ботом после ошибки.
Почему проект заинтересовал исследователей
Традиционные исследования с участием людей требуют времени на поиск участников, организацию опросов и обработку результатов. В MatrAIx параллельные испытания виртуальных пользователей могут давать первоначальные результаты в течение нескольких часов.
Авторы проекта создали библиотеку из 1 010 готовых исследовательских задач, охватывающих более 25 сфер. Среди них коммерция, программное обеспечение, финансы и здравоохранение, при этом сам факт наличия задачи в библиотеке еще не означает, что она была экспериментально выполнена.
В рамках представленного исследования команда провела 18 189 испытаний по восьми задачам. В экспериментах использовались три языковые модели, которые управляли виртуальными персонами.
Насколько реалистично ведут себя виртуальные люди
Создатели отдельно проверили, насколько агенты придерживаются характеристик, заданных их персонам. В контролируемом эксперименте с 400 испытаниями заявленное поведение было выражено или корректно подавлено в 91,5% случаев.
При этом сами авторы исследования предупреждают о существенном ограничении технологии. Правдоподобный ответ ИИ еще не доказывает, что виртуальный пользователь действительно ведет себя так же, как реальный человек.
На поведение агента влияет используемая языковая модель. Поэтому результаты симуляции необходимо интерпретировать с учетом того, какая модель управляла виртуальными персонами и каким образом формировалась выборка.
Можно ли заменить реальные опросы
MatrAIx рассматривается прежде всего как инструмент предварительного тестирования. Он позволяет быстро обнаруживать потенциальные проблемы продукта, сравнивать разные группы пользователей и повторять один сценарий после внесения изменений.
При этом исследователи не предлагают полностью отказаться от участия людей. В самой работе подчеркивается, что человеческая оценка остается необходимой для понимания того, насколько результаты симуляции соответствуют реальному поведению.
Читайте также: Стриминг как профессия: чему Казахстан может научиться у рынка Live Commerce