Математики научили ИИ-модели общаться без слов
Команда стартапа Mostik представила метод, который позволяет ИИ-моделям обмениваться внутренними состояниями без генерации промежуточного текста. Традиционно при совместной работе нескольких нейросетей промежуточным звеном служит сгенерированный текст. В Mostik отказались от этого этапа: вместо текста используется отдельный адаптируемый модуль («мост»), преобразующий внутреннее представление одной модели в форму, понятную для другой. Параметры самих моделей при таком взаимодействии не корректируются. По оценке разработчиков, перед созданием одного токена LLM формирует более сотни скрытых векторов — около миллиона числовых значений, или примерно 2 МБ внутреннего состояния. В текстовый ответ попадает лишь малая часть этой информации. Новый канал предназначен для передачи именно таких промежуточных представлений. Схема передачи информации из внутренних состояний языковой модели. Источник: Mostik. Тест на большой и малой моделях Для демонстрации метода команда связала GLM-5.2 от Z.ai на 753 млрд параметров и Qwen-3.5 от Alibaba — на 4 млрд. Большая модель только обрабатывала запрос и не генерировала ответ. После этого ее внутреннее состояние передавалось через «мост», а итоговый текст формировала Qwen-3.5. Схема взаимодействия GLM-5.2 и Qwen-3.5 через промежуточный модуль. Источник: Mostik. По данным Mostik, такая связка закрыла около половины разрыва в качестве между малой и большой моделями. При сравнении с обычной передачей текста преимущество нового метода достигало 10 процентных пунктов при одинаковом объеме вычислений. Результаты GLM-5.2 и Qwen-3.5 с использованием «моста». По данным Mostik. Разработчики также сравнили гибридную систему с моделью среднего размера, показавшей сопоставимый результат. По их расчетам, связка GLM-5.2 и Qwen-3.5 потребовала примерно в 2,5 раза меньше вычислений. Между моделями ищут общий «язык» Главный научный сотрудник Mostik Станислав Смирнов отметил, что внутренние представления разных нейросетей нельзя напрямую сопоставить друг с другом. Даже если две модели решают одну и ту же задачу, они могут по-разному кодировать полученную информацию внутри своих скрытых состояний. «Похоже, подходящего математического языка пока не существует», — заявил он в разговоре с WIRED. По словам Смирнова, изучение таких соответствий может помочь лучше понять, как разные ИИ-системы представляют информацию и приходят к решениям. В перспективе математический анализ внутренних состояний также может показать, существуют ли общие закономерности в рассуждениях разных моделей. Бывший исследователь Google DeepMind Карл Туйлс, ознакомившийся с разработкой, обратил внимание на практическую сторону подхода. Большую и ресурсоемкую модель можно задействовать только для обработки запроса, а генерацию ответа передать значительно меньшей. Другой возможный сценарий — объединение универсальной модели со специализированной. Например, одна система может отвечать за общие рассуждения, а другая быть обучена для работы с задачами из биологии, физики или другой узкой области. В таком случае их возможности можно было бы объединить без обучения одной большой модели на всем наборе специализированных данных. Технический руководитель Lovable Владимир Арустамян предположил, что подобный подход способен повысить востребованность узкоспециализированных моделей: вместо попытки создать одну нейросеть для всех задач разработчики смогут комбинировать несколько систем с разными компетенциями. Пока такие сценарии остаются потенциальными — Mostik публично продемонстрировала метод только на отдельных связках моделей. Метод применили в ARC-AGI-3 Команда Mostik применила свой подход и в ARC-AGI-3 — наборе сложных интерактивных задач, где ИИ должен не воспроизводить знакомые шаблоны, а самостоятельно разбираться в новых правилах и адаптироваться по ходу решения. По словам разработчиков, система с использованием их «моста» показала один из лучших результатов в текущем рейтинге. Подробности команда пока не раскрывает, поскольку соревнование продолжается. При этом этот результат нельзя считать полностью подтвержденным извне. В ARC-AGI-3 есть предварительные данные со статусом «превью», которые могут основываться на неполном наборе тестов и еще не считаются финальными. Остальные заявленные показатели Mostik — например, сокращение разрыва между большой и малой моделью и снижение вычислительных затрат — тоже пока основаны на внутренних экспериментах команды. Напомним, в конце августа компания OpenAI обнаружила тайный канал связи между своими ИИ-агентами. Они получили доступ в открытый интернет через менеджер пакетов Artifactory и превратили его во внутренний мессенджер. https://forklog.com/exclusive/ai/kak-ii-agenty-nauchilis-otravlyat-drug-druga