- Главная
- Mac
- MacBook Pro
- MacBook Pro 16" (2023) M3
- Ноутбук Apple MacBook Pro 16″ M3 Max Silver Z1AJ00192 (2023)
Конфигурация рассчитана на AI/ML-инженеров и энтузиастов, запускающих локальные языковые модели до 70B параметров, VFX-художников, работающих с крупными сценами в Nuke или Houdini, и специалистов, которым нужно держать в памяти одновременно тяжёлый 3D-рендеринг и несколько ML-инструментов. Чип остаётся тем же M3 Max 14CPU/30GPU, что и в версии с 36GB — здесь платят за память, а не за GPU-мощность.
96GB позволяет запускать Llama 3 70B в Q4_K_M-квантизации со скоростью 10–15 tokens/s через Ollama — такая модель занимает около 40–45GB с учётом KV-cache и комфортно помещается в память с запасом, тогда как версия с 36GB того же чипа таких моделей не потянет вовсе (потолок — около 34B). На дискретной видеокарте вроде RTX 4090 модель 70B требует частичной выгрузки слоёв в системную память и просаживает скорость до 8–15 tokens/s при энергопотреблении в сотни ватт — здесь единая память снимает это ограничение при потреблении в десятки ватт.
GPU остаётся 30-ядерным и с пропускной способностью 300GB/s — теми же, что и в версии с 36GB на этом чипе: лишняя память ускоряет не графику, а объём задач, которые помещаются в неё одновременно. Для действительно тяжёлых GPU-сцен при сопоставимом объёме памяти есть чип 16CPU/40GPU, но ровно 96GB для него не предусмотрено — доступны только 64GB либо сразу 128GB. Базовый SSD на 512GB быстро заполняется, если хранить веса нескольких локальных моделей вместе с проектами.
Для каких задач чаще всего берут
Локальные AI-модели
ML / Data Science
3D / Рендеринг
Анимация / Motion
Видеомонтаж
Наука / Вычисления
Хвалят
96GB позволяет запускать локальные модели уровня Llama 3 70B в Q4_K_M — 10–15 tokens/s через Ollama, порог комфортного интерактивного диалога
Единый пул памяти вмещает 70B-модель (~40–45GB с KV-cache) с запасом, тогда как версия с 36GB того же чипа таких моделей не потянет
Энергопотребление при локальном инференсе измеряется десятками ватт против сотен у дискретных GPU вроде RTX 4090 при сопоставимой задаче
На RTX 4090 модель 70B требует частичной выгрузки слоёв в системную память и падает до 8–15 tokens/s — единая память здесь снимает это ограничение
Объём памяти достаточен для параллельной работы тяжёлого 3D-рендеринга и нескольких ML-инструментов без выгрузки на диск
Автономность и экран на уровне остальных версий M3 Max — 12–15 часов смешанной нагрузки, Liquid Retina XDR до 1600 нит в HDR
Жалуются
GPU остаётся 30-ядерным с пропускной способностью 300GB/s — теми же, что и версия с 36GB на этом же чипе, лишняя память не ускоряет графику
Для чипа 16CPU/40GPU нет конфигурации ровно 96GB — придётся выбирать либо 64GB, либо сразу 128GB, если нужна и память, и более мощный GPU
Базовый SSD 512GB быстро заполняется, если хранить локальные LLM-веса (десятки гигабайт на модель) вместе с проектами
Скорость 10–15 tokens/s на 70B-моделях — это порог комфортного использования, а не запас: для более отзывчивого диалога нужны модели меньшего размера
Существенная переплата к версии с 36GB на том же чипе — тем, кому не нужны модели крупнее 30B, конфигурация не даёт ощутимых преимуществ
Память нельзя расширить после покупки — 96GB не потолок чипа M3 Max, но следующий шаг (128GB) требует уже чипа 16CPU/40GPU


