Разница между H100 и H200 сводится к памяти. Вычислительная часть у них одна и та же: архитектура Hopper, те же тензорные ядра, тот же Transformer Engine с FP8. Отличаются объём и скорость памяти — 80 ГБ HBM3 против 141 ГБ HBM3e, 3,35 ТБ/с против 4,8 ТБ/с. Дальше всё считается из этих двух цифр.
Менеджер свяжется в течение часа, согласует конфигурацию и вышлет коммерческое предложение в PDF.
H200 — не новое поколение, а рефреш Hopper. NVIDIA оставила вычислительное ядро как было и поменяла стек памяти: HBM3 на HBM3e. Отсюда 141 ГБ вместо 80 и 4,8 ТБ/с вместо 3,35. Остальное в спецификации совпадает: NVLink четвёртого поколения на 900 ГБ/с, TDP до 700 Вт у модуля SXM, тот же форм-фактор SXM5, те же тензорные ядра четвёртого поколения с поддержкой FP8.
Для закупки это значит, что платформа не меняется. HGX H200 собирается по той же схеме, что HGX H100: восемь модулей на baseboard, связанных через NVSwitch. Шасси, питание и охлаждение, рассчитанные на восьмёрку H100 SXM по 700 Вт, подойдут и под H200 SXM.
Модули для платформ HGX и DGX — то, что чаще всего сравнивают при выборе узла на 8 GPU.
| Характеристика | NVIDIA H100 SXM | NVIDIA H200 SXM |
|---|---|---|
| Архитектура | Hopper | Hopper |
| Память | 80 ГБ HBM3 | 141 ГБ HBM3e |
| Пропускная способность памяти | 3,35 ТБ/с | 4,8 ТБ/с |
| FP8 Tensor | 3958 TFLOPS | 3958 TFLOPS |
| FP16 / BF16 Tensor | 1979 TFLOPS | 1979 TFLOPS |
| TF32 Tensor | 989 TFLOPS | 989 TFLOPS |
| FP64 Tensor | 67 TFLOPS | 67 TFLOPS |
| NVLink | 900 ГБ/с (4-е поколение) | 900 ГБ/с (4-е поколение) |
| TDP | до 700 Вт | до 700 Вт |
| Форм-фактор | SXM5 | SXM5 |
| Платформы | HGX H100, DGX H100 | HGX H200, DGX H200 |
Значения тензорных ядер приведены так же, как в datasheet NVIDIA — с учётом разреженности. Плотные (dense) вдвое ниже: 1979 TFLOPS FP8 и 989 TFLOPS FP16.
Карты для обычных серверов, без HGX-платформы и NVSwitch.
| Характеристика | H100 PCIe | H100 NVL (на карту) | H200 NVL |
|---|---|---|---|
| Память | 80 ГБ | 94 ГБ HBM3 | 141 ГБ HBM3e |
| Пропускная способность | 2 ТБ/с | 3,9 ТБ/с | 4,8 ТБ/с |
| FP8 Tensor | 3026 TFLOPS | 3958 TFLOPS | 3341 TFLOPS |
| FP16 / BF16 Tensor | 1513 TFLOPS | 1979 TFLOPS | 1671 TFLOPS |
| TDP | 300–350 Вт | 350–400 Вт | до 600 Вт |
| NVLink | 600 ГБ/с (мост) | 600 ГБ/с (мост) | 900 ГБ/с (мост, связки 2 и 4 карты) |
| Форм-фактор | 2 слота PCIe Gen5 | 2 карты по 2 слота | 2 слота PCIe |
Здесь разница не сводится к памяти. H200 NVL потребляет до 600 Вт против 300–350 Вт у H100 PCIe — это другой класс требований к питанию и продуву корпуса. Перед закупкой стоит свериться со спецификацией сервера: не каждое шасси, где живёт H100 PCIe, примет карту на 600 Вт.
Полные спецификации по моделям: NVIDIA H100 · NVIDIA H200 · NVIDIA A100 · платформы HGX
Чтобы выдать один токен, авторегрессионная модель обязана прочитать из памяти GPU все свои веса. Арифметики при этом мало, поэтому время упирается не в TFLOPS, а в пропускную способность.
Нижняя граница времени на токен
объём весов ÷ пропускная способность памяти
Модель 70B в FP8 занимает около 70 ГБ. H100 SXM: 70 ÷ 3350 ГБ/с ≈ 21 мс. H200 SXM: 70 ÷ 4800 ≈ 15 мс. Отношение — те самые 1,43, что и у пропускных способностей.
Это потолок при batch=1, реальные цифры ниже: добавляются чтение KV-кэша, накладные расходы на запуск ядер и обмен между картами. Но соотношение между H100 и H200 держится тем же, потому что упор один и тот же.
Сама NVIDIA в материалах по H200 заявляет до 1,9× на инференсе Llama 2 70B. Больше «чистых» 1,43× получается за счёт ёмкости: на 141 ГБ помещается больший batch, и за одно и то же чтение весов карта обслуживает больше запросов.
Второе следствие объёма — длина контекста и размер батча. KV-кэш считается так:
2 × слои × KV-головы × размерность головы × длина × размер элемента × batch
Llama 3.1 70B: 80 слоёв, 8 KV-голов (GQA), размерность головы 128, кэш в FP16. На один токен — 2 × 80 × 8 × 128 × 2 байта = 327 680 байт, примерно 0,33 МБ.
Дальше арифметика простая. Веса в FP8 съедают около 70 ГБ:
Оценка без активаций и фрагментации аллокатора, но порядок величин она показывает верно. Контекст 128k при batch=1 требует около 40 ГБ кэша: на H100 такой сценарий не собирается, на H200 собирается с запасом.
В FP16 та же модель весит около 141 ГБ и целиком не помещается ни на одну карту: на H200 память уйдёт под веса без остатка. Так что «70B на одной карте» — это всегда разговор про FP8 или INT8.
Обучение и prefill (обработка промпта) — это плотные матричные умножения с высокой арифметической интенсивностью. Упор идёт в тензорные ядра, а они у H100 SXM и H200 SXM одинаковые. На фиксированном числе карт приросту по FLOPS взяться неоткуда.
Память всё равно помогает, но иначе. В 141 ГБ влезает больший микробатч и более длинная последовательность, реже приходится включать градиентный чекпоинтинг и офлоад состояний оптимизатора на CPU. Прирост здесь вторичный: он от того, что реже упираешься в нехватку памяти, а не от того, что карта считает быстрее.
Порядок цифр для полного дообучения с Adam в смешанной точности — примерно 16 байт на параметр: 2 на вес FP16, 2 на градиент, 4 на мастер-копию FP32 и 8 на два момента оптимизатора. Для 70B это около 1,1 ТБ только под состояние обучения, без активаций. Поэтому 70B не дообучают на одной карте ни в 80, ни в 141 ГБ: минимальная единица — узел из восьми GPU. Это 640 ГБ у H100 и 1128 ГБ у H200.
Часто разумнее смешанный парк: H200 под продакшен-инференс, H100 под обучение и эксперименты. Программный контур у них общий, так что команде не придётся держать две сборки. Если бюджет позволяет смотреть на поколение вперёд — считайте ещё и B200: там уже другая архитектура, Blackwell, с FP4 и 192 ГБ HBM3e.
Обе карты — Hopper с вычислительной способностью 9.0. Всё, что собрано под H100 (CUDA, cuDNN, TensorRT-LLM, vLLM, PyTorch), идёт на H200 без пересборки и правок в коде. Обновить нужно драйвер, на этом список требований заканчивается. FP8 и Transformer Engine работают одинаково на обеих.
По инфраструктуре SXM-модули взаимозаменяемы на уровне требований к стойке: 700 Вт, тот же NVSwitch, та же схема охлаждения. Пересчитывать питание и продув придётся только при переходе на PCIe-вариант H200 NVL с его 600 Вт.
Оставьте контакты — инженер LEGION GPU свяжется в течение часа. Отметьте срочность в заявке — ответим в первую очередь.
Менеджер свяжется в течение часа в рабочее время.
Если вашего вопроса нет в списке — оставьте заявку, ответим лично.