Рост агентских AI-нагрузок усиливает требования к памяти в AI-ЦОД
Редакция ЦОД:Главное
По приведённым данным OpenRouter, к августу 2026 года AI-агенты использовали примерно в пять раз больше токенов, чем люди. Основная часть агентского трафика связана с повторным чтением контекста и кэшированными промптами, что переносит часть инфраструктурной нагрузки с вычислений на память и её пропускную способность.
- Агентское потребление токенов, по приведённым данным, выросло примерно в 14 раз после февраля — до 7,3 трлн токенов.
- Человеческое потребление за тот же период достигло 1,4 трлн токенов при росте примерно в 2,8 раза.
- Более 85% агентских токенов в пересказе позиции a16z связано с кэшированными промптами.
- Рост агентных нагрузок может повысить роль HBM, RAM, KV-кэша и систем хранения в конфигурациях AI-ЦОД.
- Прогноз Micron по RAM и накопителям на 2027–2028 годы остаётся прогнозным утверждением.
AI-агенты к августу 2026 года использовали примерно в пять раз больше токенов, чем пользователи-люди, согласно данным OpenRouter, приведённым в публикации TechNews. После февраля агентское потребление выросло приблизительно с 0,51 трлн до 7,3 трлн токенов — примерно в 14 раз. За тот же период человеческое потребление увеличилось примерно в 2,8 раза, до 1,4 трлн токенов.
Структура агентской нагрузки делает особенно важной подсистему памяти. По пересказу позиции a16z, более 85% токенов AI-агентов приходится на кэшированные промпты. Это означает многократное обращение к ранее накопленному контексту и рост требований к KV-кэшу, HBM, системной RAM, хранению и пропускной способности между компонентами инфраструктуры.
Отдельный пример из публикации иллюстрирует характер такой нагрузки: в описанном кейсе использования Claude Code в сентябре 96% входных данных приходилось на повторное чтение старых диалогов. Этот пример не характеризует весь рынок, но показывает, почему увеличение токенов не обязательно означает пропорциональный рост новых вычислений: значительная часть операций может быть связана с обслуживанием контекста.
Для AI-ЦОД это может означать изменение приоритетов при проектировании и закупках серверов. Наряду с ускорителями всё более критичными могут становиться объём и пропускная способность памяти, конфигурация KV-кэша и доступность систем хранения. Micron, согласно статье, ожидает ухудшения дефицита RAM и накопителей в 2027–2028 годах, а также приоритетного распределения HBM для AI-ЦОД. Это является прогнозом, а не подтверждением уже наступившего дефицита.
Количественный масштаб последствий для инвестиций в инфраструктуру пока не установлен: в предоставленных материалах отсутствуют данные об объёмах поставок памяти, ценах, фактических конфигурациях серверов и мощности ЦОД. Тем не менее описанная динамика указывает на риск того, что ограничением для части AI-развертываний станет не только доступность вычислительных ускорителей, но и цепочка поставок memory-компонентов.
Для операторов и проектировщиков AI-ЦОД рост агентных нагрузок может повысить требования к HBM, системной RAM, хранению контекста и архитектуре KV-кэша, а не только к GPU. Если эта динамика сохранится, поставки и стоимость компонентов памяти могут стать одним из ключевых ограничений при развертывании AI-инфраструктуры.
- TechNews 科技新報 / КитайскийПервоисточник →
Материал подготовлен редакцией ЦОД: Главное на основе указанных первоисточников.