
Последние годы казалось, что искусственный интеллект растёт без ограничений: каждая новая модель умнее предыдущей, а данные для обучения берутся буквально из воздуха. Но за этим ростом прячется малоприметная угроза — интернет, главный «учебник» для нейросетей, перестаёт быть бесконечным источником.
📚 Где ИИ берёт знания
Современные большие языковые модели — это, по сути, гигантские «энциклопедии», выжатые из текстов. Чтобы обучить модель уровня GPT или аналогичных систем, нужны сотни миллиардов слов: книги, статьи, сайты, форумы, научные работы, диалоги. Считается, что на обучение флагманских моделей уходит значительная часть всего качественного текста, который человечество выложило в открытый доступ.
Проблема в том, что этот ресурс конечен.
📏 Сколько всего текста существует
Оценки различаются, но общая картина тревожная. Учёные из исследовательского проекта Epoch AI подсчитали: доступных для обучения высококачественных текстовых данных в мире — порядка десятков триллионов слов. При этом каждая новая волна моделей «съедает» всё больше. По консервативным прогнозам, верхняя граница качественных данных будет достигнута в период примерно с 2030 по 2050 год, а по некоторым оценкам — даже раньше, уже к концу текущего десятилетия.
Ключевое слово здесь — «качественные». В интернете, конечно, появляются новые тексты каждый день, но подавляющее большинство из них — дубликаты, пересказы, технический мусор и машинный контент. Действительно новых, оригинальных знаний генерируется куда меньше, чем кажется.
🔄 Парадокс самоограничения
Самое ироничное — ИИ сам ускоряет исчерпание собственного сырья. Сегодня огромная доля контента в сети создаётся нейросетями: статьи, посты, комментарии, изображения. Такие данные для обучения почти бесполезны, а иногда и вредны. Модель, обученная на машинном тексте, рискует «выродиться»: она начинает повторять шаблоны своих предшественников, теряет разнообразие и оригинальность. Исследователи называют это явление «коллапсом модели» — когда модель, обученная на своих же выходах, за несколько поколений деградирует до бессмысленного повторения.
Получается замкнутый круг: людям всё меньше хочется писать, потому что ИИ пишет быстрее и дешевле, — но именно человеческий текст и был тем ценным сырьём, на котором ИИ учился.
⛔ Почему это может остановить развитие
Данные — это топливо индустрии. Если его количество стабилизируется или начнёт деградировать, прогресс не просто замедлится — он может упереться в плато. Новые модели станут лишь незначительно умнее предыдущих, потому что им просто не на чем учиться. Увеличение вычислительных мощностей помогает, но без свежих качественных данных даёт всё меньший прирост.
🛠 Что предлагают в качестве выхода
Индустрия не собирается сдаваться, и уже есть несколько направлений:
- Синтетические данные. Модели всё чаще обучаются на данных, сгенерированных другими моделями. Это работает в ограниченных доменах, но несёт риск «вырождения».
- Разрешение на использование. Компании выкупают права на большие библиотеки текстов, которые раньше были недоступны — архивы, книги, корпоративные данные.
- Собственные данные пользователей. Частные данные компаний и людей — огромный неосвоенный пласт, но его использование упирается в приватность и этику.
- Новые архитектуры. Возможно, будущее не за «больше данных», а за моделями, которые эффективнее используют то, что уже знают.
🧭 Итог
Мы привыкли думать, что интернет безграничен, а прогресс ИИ — само собой разумеющееся. На самом деле и то и другое имеет пределы. Через несколько лет может оказаться, что самое дефицитное сырьё в мире — не чипы и не энергия, а качественный человеческий текст. И от того, как индустрия ответит на этот вызов — синтетикой, доступом к приватным данным или принципиально новыми подходами, — зависит, продолжится ли стремительный рост или развитие ИИ впервые за десятилетия сбавит темп.
