Президент России Владимир Путин поручил правительству организовать централизованный сбор и обработку данных, которые будут использоваться для обучения отечественных больших моделей искусственного интеллекта.
В России создадут суверенный ИИ. Владимир Путин поручил начать сбор данных

В частности, кабмину необходимо обеспечить подготовку научно-технической информации для обучения так называемых суверенных больших фундаментальных моделей ИИ. При необходимости для этого предлагается внести изменения в действующие нормативные акты.

Ответственным за выполнение поручения назначен премьер-министр Михаил Мишустин. Правительство должно представить доклад о проделанной работе до 1 марта 2027 года.
Поручение подготовлено по итогам заседания Совета при президенте по науке и образованию, которое состоялось 11 августа 2026 года.
Инициатива предполагает создание единой базы данных, пригодной для обучения отечественных ИИ-систем. При этом в опубликованной информации не уточняется, какие именно массивы данных войдут в нее, кто получит к ним доступ и какие организации будут заниматься разработкой моделей.
Речь идет прежде всего о формировании собственной инфраструктуры данных для российских ИИ-разработок, чтобы обучение крупных моделей меньше зависело от зарубежных источников и платформ.

Пока деталей нет, так что делать выводы рано. Но если речь идет о том, что суверенный ИИ должен работать на российском железе и обучаться на российских данных, у нас большие проблемы. Потому что отечественный ИИ в таком случае будет неконкурентноспособен. Мы итак отстаем от США и Китая на несколько месяцев и разрыв не сокращается. В случае, если придется пользоваться только отечественными решениями, разрыв увеличится.
И даже если железо можно использовать зарубежное, но данные только российские, проблем не избежать. Все просто: на русском языке в десятки раз меньше данных, чем на английском. Нас банально меньше, чем англоговорящих, поэтому и информации мы генерируем значительно меньше. А информация критически важна.
Ведущие ИИ-компании скупают книги тоннами для обучения моделей, пылесосят все уголки интернета и не гнушаются языком, на котором была написана информация. Главное — обучить. У такого подхода, конечно же, есть минусы: в дата-сеты часто попадает мусор и "опасная информация", но зато модели становятся все эффективнее и эффективнее, а каждое новое поколение теперь выходит быстрее, чем предыдущее. Это ли не научный прогресс?
