Сатья Наделла предупредил корпорации о рисках использования проприетарных ИИ-моделей: данные клиентов становятся активами разработчиков
Один из самых острых вопросов в дискуссиях о потенциальных угрозах искусственного интеллекта вызывает наибольшее беспокойство среди энтузиастов этой технологии в Кремниевой долине. Страх заключается в том, что крупные лаборатории, разрабатывающие ИИ и продающие проприетарные модели, действуют как «Троянские кони».
Опасения связаны с тем, что по мере использования стартапами и предприятиями моделей от таких лабораторий, как OpenAI и Anthropic, эти компании получают все больший доступ к наиболее конфиденциальной коммерческой информации своих клиентов. Разработчики моделей могут затем использовать полученные знания в собственных интересах, потенциально становясь конкурентами для тех, кто платит за их услуги. Подобные предупреждения звучат от венчурных капиталистов, таких как Джейсон Калаканис, до генерального директора Palantir Алекса Карпа.
Теперь к этому числу присоединился исполнительный директор Microsoft Сатья Наделла, опубликовавший в воскресенье неожиданную статью в блоге. Наделла предупреждает, что пользователи ИИ (которые он называет «покупателями») платят дважды. Они сознательно тратят деньги на использование токенов ИИ, но при этом неосознанно передают ценные данные в процессе работы.
«Вы по сути платите за интеллект дважды: один раз деньгами, а второй раз — чем-то еще более ценным: собственными знаниями, которые вы должны раскрыть, чтобы сделать этот интеллект полезным. Чем лучше вы хотите, чтобы модель работала, тем больше этих знаний вы должны ей передать», — пишет он.
По его мнению, самое опасное заключается в том, что предприятия буквально обучают модели тонкостям своего бизнеса. «Модели учатся на „выхлопе“: промптах, которые пишут люди, инструментах, которыми пользуются агенты, и особенно поправках, которые люди вносят, когда модель ошибается. Каждая поправка конденсируется в институциональные знания», — отмечает Наделла.
Это «тот тип знаний, который конкурент никогда не смог бы купить», однако предприятия добровольно передают их разработчикам.
Наделла утверждает, что если компаниям-разработчикам ИИ позволено свободно собирать данные из интернета для обучения своих моделей, то справедливо, чтобы предприятия также имели возможность изучать или «дистиллировать» эти модели в ответ. «Дистилляция» — это практика использования собственных выходов модели для понимания ее работы и создания новой, часто более дешевой модели на основе полученных данных. В феврале Anthropic обвинила китайские модели с открытым исходным кодом в отправке миллионов промптов в Claude для улучшения своих моделей и призвала правительство США ужесточить экспортный контроль.
Суть аргумента Наделлы заключается в том, что разработчики моделей не могут иметь все преимущества сразу. Гипокритично со стороны производителей свободно обучаться на данных всего мира, одновременно ограничивая других от совершения тех же действий с их моделями. «Хотя великие инновации, возникающие благодаря праву добросовестного использования для обучения моделей на публичных данных, необходимы, я нахожу ироничным тот факт, что статус-кво заключается в последующем наложении ограничительных условий на дистилляцию», — пишет Наделла.
Особую обеспокоенность вызывает ситуация, когда разработчики моделей «оставляют за собой право обучаться на данных о использовании и взаимодействии клиентов».
Решение, предлагаемое генеральным директором крупного облачного провайдера, заключается в том, чтобы компаниям «сохранять права собственности» на свои данные, включая промпты, обратную связь и т.д. Поэтому он призывает их создавать собственные «проприетарные обучающие среды» в облаке (где их данные, вероятно, уже хранятся, и что удобно, может означать использование облака Microsoft Azure). Он также хочет, чтобы компании внедряли то, что он называет «слоями оркестровки», — по сути, способ легко переключаться между ИИ-моделями от разных поставщиков, избегая привязки к одному. Такие инструменты, как ИИ-«шлюзы», позволяющие компаниям делать именно это, становятся все более популярными.
Хотя Наделла никогда не использует слово «открытый исходный код» как метод сохранения прав собственности, это очевидный подтекст. Однако есть и другой подтекст.
Крупные компании, многие из которых до сих пор имеют собственные дата-центры в дополнение к использованию облачных сервисов, уже переходят на модели с открытым исходным кодом, устанавливаемые на собственных серверах («on-prem» в отраслевом жаргоне). Идит Левин, основатель и генеральный директор Solo.io (компании, разрабатывающей сетевое и безопасное программное обеспечение для управления ИИ-системами предприятиями), говорит, что наблюдает именно этот сдвиг у своих клиентов. После экспериментов с проприетарными моделями они начинают задаваться вопросом: «Могу ли я взять модель с открытым исходным кодом и запустить ее локально? Она будет делать почти 90% того, что делает большая модель. Это обойдется гораздо дешевле», — рассказывает она TechCrunch. «Они понимают это и могут контролировать процесс».
Технология Solo.io была выбрана в прошлом году для реализации проекта Agentgateway от Linux Foundation. В число клиентов компании входят T-Mobile, ADP и SAP. Она видит, как все больше компаний устанавливают модели с открытым исходным кодом на собственных серверах, и считает это следующей большой волной использования ИИ в корпоративном секторе.
Она не одинока в этом наблюдении. Vercel (платформа для создания и хостинга веб-сайтов, недавно добавившая инструменты переключения между моделями ИИ) и OpenRouter (компания, помогающая разработчикам маршрутизировать запросы через различные модели ИИ) фиксируют рост трафика к моделям с открытым исходным кодом. Фактически, в прошлом месяце на открытые модели приходилось 29% всего трафика, прошедшего через шлюз Vercel.
Учитывая, что генеральный директор Microsoft, компании, инвестирующей как в OpenAI, так и в Anthropic, теперь открыто призывает предприятия проявлять осторожность при использовании проприетарных моделей, можно предположить, что этот тренд будет продолжать расти. «Потребляя интеллект, вы создаете интеллект. И то, что вы создаете, должно принадлежать вам», — пишет Наделла.


