1 Октября, 16:20
Казахстанские специалисты могут конкурировать в США: Енлик Тлепова о работе в американском бренде косметикиМультимодальные языковые модели, разработанные ведущими ИТ-компаниями, по-прежнему с трудом понимают показания аналоговых часов, сообщает ИА El.kz.
Исследователи из Эдинбургского университета (Шотландия) провели эксперимент, чтобы выяснить, насколько хорошо современные мультимодальные большие языковые модели (MLLM), такие как GPT от OpenAI, Gemini от Google и Claude от Anthropic, способны интерпретировать стрелочные часы. Результаты оказались неожиданно низкими: ИИ справился с задачей лишь в 25% случаев, тогда как большинство детей осваивают чтение времени по аналоговому циферблату в возрасте 6–7 лет.
В исследовании использовались разные типы изображений часов: с римскими и арабскими цифрами, с секундными стрелками и без них, с разнообразными цветовыми решениями. Оказалось, что особенно затруднительно для моделей было распознавание времени на стилизованных циферблатах и при наличии римских чисел.
Учёные подчёркивают, что, несмотря на впечатляющий прогресс ИИ в обработке изображений и понимании текста, визуальные задачи, связанные с пространственными соотношениями, до сих пор остаются серьёзным вызовом для машинного интеллекта.
Материал с результатами эксперимента в настоящее время ожидает научного рецензирования, но уже вызвал интерес в экспертных кругах как показатель текущих ограничений нейросетей.
Читайте также:
1 Октября, 16:20
Казахстанские специалисты могут конкурировать в США: Енлик Тлепова о работе в американском бренде косметики24 Сентября, 09:01
Как лечат сердце: интервью с интервенционным кардиологом23 Сентября, 15:55
Какие прививки делают в Казахстане: полный календарь для детей и взрослых23 Сентября, 09:01
Почему инфаркт можно не заметить и что мы не знаем о сердце