- Головна
- Mac
- MacBook Pro
- MacBook Pro 16" (2023) M3
- Ноутбук Apple MacBook Pro 16″ M3 Max Silver Z1AJ00196 (2023)
Конфігурація розрахована на AI/ML-інженерів та ентузіастів, які запускають локальні мовні моделі до 70B параметрів, VFX-художників, що працюють з великими сценами в Nuke чи Houdini, та фахівців, яким потрібно тримати в пам’яті одночасно важкий 3D-рендеринг і кілька ML-інструментів. Чип залишається тим самим M3 Max 14CPU/30GPU, що й у версії з 36GB — тут платять за пам’ять, а не за потужність GPU.
96GB дозволяє запускати Llama 3 70B у Q4_K_M-квантизації зі швидкістю 10–15 tokens/s через Ollama — така модель займає близько 40–45GB з урахуванням KV-cache і комфортно вміщується в пам’ять із запасом, тоді як версія з 36GB того самого чипа таких моделей не потягне взагалі (стеля — близько 34B). На дискретній відеокарті на кшталт RTX 4090 модель 70B потребує часткового вивантаження шарів у системну пам’ять і просідає до 8–15 tokens/s при енергоспоживанні в сотні ват — тут єдина пам’ять знімає це обмеження при споживанні в десятки ват.
GPU залишається 30-ядерним і з пропускною здатністю 300GB/s — тими самими, що й у версії з 36GB на цьому чипі: зайва пам’ять прискорює не графіку, а обсяг завдань, які поміщаються в неї одночасно. Для дійсно важких GPU-сцен при співставному обсязі пам’яті є чип 16CPU/40GPU, але рівно 96GB для нього не передбачено — доступні лише 64GB або одразу 128GB. Базовий SSD на 512GB швидко заповнюється, якщо зберігати ваги кількох локальних моделей разом із проєктами.
Для яких завдань найчастіше беруть
Локальні AI-моделі
ML / Data Science
3D / Рендеринг
Анімація / Motion
Відеомонтаж
Наука / Обчислення
Хвалять
96GB дозволяє запускати локальні моделі рівня Llama 3 70B у Q4_K_M — 10–15 tokens/s через Ollama, поріг комфортного інтерактивного діалогу
Єдиний пул пам’яті вміщує 70B-модель (~40–45GB з KV-cache) із запасом, тоді як версія з 36GB того самого чипа таких моделей не потягне
Енергоспоживання при локальному інференсі вимірюється десятками ват проти сотень у дискретних GPU на кшталт RTX 4090 при співставному завданні
На RTX 4090 модель 70B потребує часткового вивантаження шарів у системну пам’ять і падає до 8–15 tokens/s — єдина пам’ять тут знімає це обмеження
Обсягу пам’яті достатньо для паралельної роботи важкого 3D-рендерингу і кількох ML-інструментів без вивантаження на диск
Автономність та екран на рівні решти версій M3 Max — 12–15 годин змішаного навантаження, Liquid Retina XDR до 1600 ніт у HDR
Скаржаться
GPU залишається 30-ядерним із пропускною здатністю 300GB/s — тими самими, що й версія з 36GB на цьому самому чипі, зайва пам’ять не прискорює графіку
Для чипа 16CPU/40GPU немає конфігурації рівно 96GB — доведеться обирати або 64GB, або одразу 128GB, якщо потрібна і пам’ять, і потужніший GPU
Базовий SSD 512GB швидко заповнюється, якщо зберігати локальні LLM-ваги (десятки гігабайт на модель) разом із проєктами
Швидкість 10–15 tokens/s на 70B-моделях — це поріг комфортного використання, а не запас: для більш чуйного діалогу потрібні менші моделі
Суттєва переплата до версії з 36GB на тому самому чипі — тим, кому не потрібні моделі більші за 30B, конфігурація не дає відчутних переваг
Пам’ять не можна розширити після купівлі — 96GB не стеля чипа M3 Max, але наступний крок (128GB) вимагає вже чипа 16CPU/40GPU


