Перейти к содержимому
Новости

Рост агентских AI-нагрузок усиливает требования к памяти в AI-ЦОД

Редакция ЦОД:Главное

TechNews — иллюстрация к материалу
Источник изображения: TechNews

По приведённым данным OpenRouter, к августу 2026 года AI-агенты использовали примерно в пять раз больше токенов, чем люди. Основная часть агентского трафика связана с повторным чтением контекста и кэшированными промптами, что переносит часть инфраструктурной нагрузки с вычислений на память и её пропускную способность.

Главное
  • Агентское потребление токенов, по приведённым данным, выросло примерно в 14 раз после февраля — до 7,3 трлн токенов.
  • Человеческое потребление за тот же период достигло 1,4 трлн токенов при росте примерно в 2,8 раза.
  • Более 85% агентских токенов в пересказе позиции a16z связано с кэшированными промптами.
  • Рост агентных нагрузок может повысить роль HBM, RAM, KV-кэша и систем хранения в конфигурациях AI-ЦОД.
  • Прогноз Micron по RAM и накопителям на 2027–2028 годы остаётся прогнозным утверждением.

AI-агенты к августу 2026 года использовали примерно в пять раз больше токенов, чем пользователи-люди, согласно данным OpenRouter, приведённым в публикации TechNews. После февраля агентское потребление выросло приблизительно с 0,51 трлн до 7,3 трлн токенов — примерно в 14 раз. За тот же период человеческое потребление увеличилось примерно в 2,8 раза, до 1,4 трлн токенов.

Структура агентской нагрузки делает особенно важной подсистему памяти. По пересказу позиции a16z, более 85% токенов AI-агентов приходится на кэшированные промпты. Это означает многократное обращение к ранее накопленному контексту и рост требований к KV-кэшу, HBM, системной RAM, хранению и пропускной способности между компонентами инфраструктуры.

Отдельный пример из публикации иллюстрирует характер такой нагрузки: в описанном кейсе использования Claude Code в сентябре 96% входных данных приходилось на повторное чтение старых диалогов. Этот пример не характеризует весь рынок, но показывает, почему увеличение токенов не обязательно означает пропорциональный рост новых вычислений: значительная часть операций может быть связана с обслуживанием контекста.

Для AI-ЦОД это может означать изменение приоритетов при проектировании и закупках серверов. Наряду с ускорителями всё более критичными могут становиться объём и пропускная способность памяти, конфигурация KV-кэша и доступность систем хранения. Micron, согласно статье, ожидает ухудшения дефицита RAM и накопителей в 2027–2028 годах, а также приоритетного распределения HBM для AI-ЦОД. Это является прогнозом, а не подтверждением уже наступившего дефицита.

Количественный масштаб последствий для инвестиций в инфраструктуру пока не установлен: в предоставленных материалах отсутствуют данные об объёмах поставок памяти, ценах, фактических конфигурациях серверов и мощности ЦОД. Тем не менее описанная динамика указывает на риск того, что ограничением для части AI-развертываний станет не только доступность вычислительных ускорителей, но и цепочка поставок memory-компонентов.

Почему это важно

Для операторов и проектировщиков AI-ЦОД рост агентных нагрузок может повысить требования к HBM, системной RAM, хранению контекста и архитектуре KV-кэша, а не только к GPU. Если эта динамика сохранится, поставки и стоимость компонентов памяти могут стать одним из ключевых ограничений при развертывании AI-инфраструктуры.

Источники

Материал подготовлен редакцией ЦОД: Главное на основе указанных первоисточников.