Ваш браузер устарел и не обеспечивает полноценную и безопасную работу с сайтом. Пожалуйста обновите браузер чтобы улучшить взаимодействие с сайтом.

Сервер для локального ИИ: 1, 2 или 4 GPU

6 октября 2026
1
0 комментариев

Количество GPU для локального ИИ зависит от модели, объема видеопамяти, характера вычислений и нагрузки. Разбираем, когда достаточно одного ускорителя, в каких сценариях нужны две или четыре GPU и какие требования это предъявляет к серверу.

В этой статье:

Сколько GPU нужно для локального ИИ и от чего это зависит

В локальной инфраструктуре ИИ-модель работает на сервере компании. Основные вычисления обычно выполняют GPU, поэтому при подборе сервера важно заранее понять, сколько ускорителей потребуется проекту. Само число пользователей или размер компании здесь мало что подсказывают. Две организации с одинаковым количеством сотрудников могут получить совершенно разную нагрузку.

Количество GPU определяют по нескольким параметрам: размеру модели, требуемому объему видеопамяти, режиму работы и числу одновременных задач. Эти параметры нужно рассматривать вместе.

Сколько видеопамяти требуется модели

Первое ограничение задает видеопамять GPU. Во время работы в ней размещаются параметры модели и данные, которые нужны для вычислений. Если доступного объема недостаточно, модель целиком на одной GPU не разместится.

При этом ориентироваться только на число параметров модели нельзя. На расход памяти влияет формат, в котором хранятся числовые значения, а во время работы появляются дополнительные данные. Например, при обработке длинного контекста модель использует больше памяти.

Поэтому две модели одинакового размера могут предъявлять разные требования к GPU. Перед подбором сервера важно знать конкретную модель и настройки, с которыми ее планируют запускать.

Что сервер будет делать с моделью

Требования сильно зависят от режима работы.

Запуск готовой модели означает, что сервер получает запрос и формирует ответ. Здесь важны объем видеопамяти, скорость обработки и количество запросов, которые система должна обслуживать одновременно.

Дообучение изменяет уже существующую модель на собственных данных. Во время такого процесса серверу требуется больше ресурсов, поскольку он выполняет дополнительные вычисления и хранит промежуточные данные, необходимые для изменения параметров модели.

Полное обучение предъявляет еще более высокие требования. Сервер многократно обрабатывает обучающие данные и пересчитывает параметры модели. Поэтому конфигурация, которой достаточно для обычного запуска, может оказаться недостаточной для обучения той же модели.

Сколько запросов сервер должен обрабатывать одновременно

Модель может помещаться в память одной GPU, но это еще не означает, что одного ускорителя хватит для рабочей нагрузки.

Например, один пользователь последовательно отправляет запросы внутреннему помощнику. В другом проекте к той же модели одновременно обращаются десятки сотрудников или несколько корпоративных сервисов. Требования к производительности во втором случае будут выше, хотя сама модель не изменилась.

Поэтому при подборе важно знать предполагаемое число одновременных запросов и допустимое время ответа. Эти данные помогают понять, хватает ли одной GPU по производительности или потребуется больше вычислительных ресурсов.

Одна модель или несколько

На одном сервере компания может запускать одну модель или сразу несколько. Например, одна отвечает за работу с текстом, другая обрабатывает документы, третья используется для отдельного внутреннего сервиса.

В такой ситуации ресурсы нужно оценивать уже для всей совокупной нагрузки. Даже если каждая модель по отдельности помещается на одной GPU, их одновременная работа может потребовать больше видеопамяти и вычислительной мощности.

То же относится к нескольким независимым задачам. Сервер может одновременно обслуживать пользователей, выполнять обработку документов и запускать другие вычисления. Количество GPU тогда определяют с учетом всего рабочего сценария.

Как получить первый ориентир по количеству GPU

Для предварительной оценки нужно ответить на четыре вопроса:

  • определить, какую модель планируют использовать;
  • уточнить, будет ли сервер запускать готовую модель, дообучать ее или обучать;
  • оценить число одновременных запросов и параллельных задач;
  • проверить, сколько видеопамяти и вычислительных ресурсов требует выбранный сценарий.

Если задача укладывается в ресурсы одной GPU, конфигурацию можно строить вокруг одного ускорителя. Две или четыре GPU рассматривают, когда проекту требуется больший объем ресурсов для модели, параллельной работы или вычислений.

Но здесь появляется следующий важный вопрос: несколько GPU внутри одного сервера могут использоваться по-разному. От этого зависит, что именно даст переход от одной карты к двум или четырем. Это разберем в следующей главе.

Иконка вопроса
Иконка вопроса
Важно!

Количество GPU выбирают по модели, объему видеопамяти, режиму работы и параллельной нагрузке. Само число пользователей не дает достаточного ориентира.

Как работают 1, 2 или 4 GPU в одном сервере

При одной GPU вся работа проходит внутри одного ускорителя. Когда в сервере установлены две или четыре карты, появляется несколько способов распределить вычисления. Поэтому одинаковое количество GPU еще не означает одинаковую схему работы.

Одна модель на нескольких GPU

Первый вариант — разделить одну модель между несколькими ускорителями. Программное обеспечение распределяет ее части по двум или четырем GPU, а затем объединяет результаты вычислений.

Разделить работу можно по-разному. Например, одна GPU выполняет часть слоев модели и передает результат следующей. В другой схеме несколько ускорителей одновременно выполняют разные части одного вычисления. Конкретный способ зависит от модели и программного обеспечения.

Для пользователя здесь важен сам принцип: один запрос может проходить через несколько GPU. Карты в такой конфигурации должны обмениваться промежуточными данными и согласовывать вычисления.

Чем больше ускорителей участвует в одной операции, тем большее значение получает обмен между ними. Поэтому переход с одной GPU на две или с двух на четыре не означает автоматического увеличения скорости в два раза.

Несколько GPU для независимых задач

Ускорители не обязательно должны совместно обслуживать одну модель. Каждая GPU может получить отдельную работу.

Например, на двух картах можно запустить два экземпляра одной модели и направлять запросы на свободный ускоритель. Другой вариант — разместить на GPU разные модели. При четырех картах возможны и смешанные схемы: две GPU работают с одной моделью, а оставшиеся две обслуживают другую задачу.

В такой архитектуре карты меньше зависят друг от друга, поскольку каждой назначена собственная нагрузка. Она подходит для случаев, когда серверу нужно одновременно выполнять несколько независимых вычислений.

Таким образом, две или четыре GPU дают два принципиально разных варианта: объединить ресурсы для одной задачи или распределить между картами несколько задач.

Что происходит с видеопамятью нескольких GPU

У каждой GPU есть собственная физическая видеопамять. Если установить две карты по 80 ГБ, сервер не получит одну общую область памяти объемом 160 ГБ.

Программное обеспечение может разместить разные части одной модели на разных ускорителях. Тогда система задействует память обеих карт, но каждая GPU по-прежнему работает со своей областью. Поэтому такую конфигурацию нельзя считать полным аналогом одной карты со 160 ГБ видеопамяти.

Это различие особенно важно при оценке крупных моделей. Суммарный объем памяти всех GPU показывает потенциально доступный ресурс, но реальная возможность его использовать зависит от способа распределения модели и программного обеспечения.

Как GPU передают данные друг другу

Если несколько ускорителей работают над одной задачей, им приходится регулярно обмениваться результатами вычислений. Для этого сервер использует доступные соединения между устройствами.

Базовый путь обмена проходит через PCIe — интерфейс, через который GPU подключаются к серверной платформе. Некоторые ускорители NVIDIA также поддерживают NVLink. Это отдельное высокоскоростное соединение для передачи данных между GPU. В части многопроцессорных систем применяется NVSwitch, который связывает несколько ускорителей через общую коммутационную схему.

Тип соединения особенно важен для конфигураций, где одна модель постоянно распределяет вычисления между несколькими GPU. Если карты работают в основном независимо, интенсивность обмена между ними может быть значительно ниже.

Что меняется при переходе от 2 к 4 GPU

Принцип работы остается тем же. Четыре ускорителя дают больше вариантов распределения вычислений.

Одну модель можно разделить между четырьмя GPU. Можно создать две группы по две карты. Можно назначить каждому ускорителю независимую нагрузку. Конкретную схему выбирают с учетом возможностей программного обеспечения и самой модели.

Одновременно растет сложность взаимодействия между устройствами. Если все четыре GPU участвуют в одном вычислении, системе приходится согласовывать работу большего числа ускорителей. Поэтому эффективность такой конфигурации зависит от того, насколько хорошо задача распределяется между картами и сколько данных им приходится передавать друг другу.

Получается, что 1, 2 и 4 GPU различаются не просто количеством вычислительных устройств. С одной картой все вычисления сосредоточены на одном ускорителе. Несколько GPU позволяют разделить одну модель между устройствами, выполнять независимые задачи или сочетать оба подхода.

Цитата
Цитата
Количество GPU показывает доступный вычислительный ресурс. Итоговая производительность зависит от распределения модели, обмена данными и программного обеспечения.
— Редакция CRABBIT

Какой сервер нужен для 1, 2 или 4 GPU

Выбрать нужное количество GPU недостаточно. Серверная платформа должна поддерживать конкретные ускорители с учетом их исполнения, подключения, питания и охлаждения. Поэтому перед закупкой проверяют совместимость всей конфигурации, а не только наличие свободных разъемов.

Поддерживает ли сервер выбранные GPU

Первое, что нужно проверить, это список ускорителей, которые производитель допускает для конкретной модели сервера. Две карты с одинаковым интерфейсом подключения могут отличаться размерами, энергопотреблением и требованиями к охлаждению.

Имеет значение и исполнение GPU. Карты PCIe устанавливают в соответствующие разъемы сервера. Ускорители SXM рассчитаны на специальные серверные платформы и устанавливаются иначе. Заменить один вариант другим без учета конструкции сервера нельзя.

Для конфигураций с двумя и четырьмя GPU также проверяют, сколько ускорителей нужного типа поддерживает выбранное шасси. Физическое число разъемов само по себе этого не показывает.

Хватает ли линий PCIe

Для GPU важно полноценное подключение к серверной платформе. Поэтому нужно проверить, с какой шириной PCIe работают слоты, предназначенные для ускорителей, и как они связаны с процессорами.

Это особенно важно в сервере с несколькими GPU. Процессор предоставляет ограниченное число линий PCIe, которые используют также сетевые адаптеры, NVMe-накопители и другие устройства. Конкретная серверная платформа распределяет эти линии по своей схеме.

При выборе сервера с двумя или четырьмя GPU поэтому смотрят документацию на всю конфигурацию: какие слоты предназначены для ускорителей, какую ширину подключения они получают и какие ограничения появляются при установке других плат расширения.

Как подобрать процессор и оперативную память

Количество GPU само по себе не определяет модель процессора и объем оперативной памяти. Эти параметры зависят от того, какую часть работы выполняет центральный процессор и сколько данных система хранит вне видеопамяти.

При этом процессор влияет на возможности всей платформы. От его архитектуры и серверной схемы зависит доступ к PCIe, памяти и другим устройствам. В некоторых многопроцессорных серверах производитель также задает требования к распределению GPU между процессорами.

Оперативную память подбирают под программную среду и рабочие данные. Простое правило вроде определенного количества гигабайт оперативной памяти на одну GPU не подходит для всех проектов. Требования нужно считать для конкретной нагрузки.

Хватит ли питания

Для каждой поддерживаемой GPU производитель сервера определяет допустимую конфигурацию питания. При установке нескольких ускорителей растет общая потребляемая мощность системы, поэтому нужно учитывать процессоры, память, накопители, сетевые платы и остальные компоненты.

Проверяют мощность и количество блоков питания, допустимые сочетания компонентов и возможность резервирования. Для части серверов конфигурация с GPU требует определенных блоков питания или дополнительных комплектов подключения.

Поэтому запас по мощности нельзя оценивать только по сумме паспортного потребления ускорителей.

Справится ли сервер с охлаждением

GPU с высоким энергопотреблением выделяют значительное количество тепла. Сервер должен отводить его в пределах условий, которые указал производитель.

Для некоторых конфигураций требуются усиленные вентиляторы, специальные воздуховоды или определенное расположение плат. Допустимое число ускорителей также может зависеть от выбранных процессоров и других компонентов.

Особенно важно проверять поддержку конкретной модели GPU. Карта может физически помещаться в сервер, но это еще не подтверждает нормальную работу системы при длительной нагрузке.

Можно ли увеличить количество GPU позже

Если сервер сначала покупают с одной GPU, а затем планируют установить две или четыре, возможность расширения лучше проверить до закупки платформы.

Нужно заранее убедиться, что сервер поддерживает нужное максимальное число ускорителей. Также проверяют свободные слоты, линии PCIe, блоки питания, охлаждение и необходимые комплекты для установки GPU.

Поэтому конфигурация с одной картой и сервер, рассчитанный на последующее расширение до четырех GPU, могут начинаться с разного набора компонентов.

В результате сервер под GPU выбирают как единую систему. После определения числа ускорителей проверяют совместимость шасси, схему PCIe, процессоры, оперативную память, питание и охлаждение. В следующей главе разберем, как эти требования выглядят в конкретных конфигурациях под разные задачи.

Серверы Supermicro для конфигураций с GPU
Показать варианты →
Реклама 16+. ООО «ГК КРЭББИТ» ИНН 7722377552 ОГРН: 1167746991170 107023, г. Москва, вн.тер.г. муниципальный округ Преображенское, ул. Малая Семеновская, д. 9, стр. 3

Примеры конфигураций серверов под разные задачи: 1, 2 и 4 GPU

После расчета нагрузки можно переходить к конкретной сборке. Ниже три варианта для разных сценариев локального ИИ. Состав процессоров, оперативной памяти и накопителей в реальном проекте корректируют под модель, объем данных и используемое программное обеспечение.

1 GPU: внутренний ИИ-помощник и обработка документов

Для локального сервиса, который работает с одной моделью и не требует нескольких полноразмерных ускорителей, можно рассмотреть Dell PowerEdge R760 с NVIDIA L4 24 ГБ.

Пример конфигурации:

  • Dell PowerEdge R760;
  • 1 × NVIDIA L4 24 ГБ;
  • 2 × Intel Xeon Scalable;
  • 256 ГБ DDR5 RDIMM;
  • NVMe-накопители для системы, модели и рабочих данных.

Такая сборка подходит для внутреннего помощника, поиска и подготовки ответов по корпоративным документам, классификации текстов и других сценариев, где выбранная модель укладывается в память L4.

Главное ограничение здесь задает сама GPU. Если для модели требуется больше 24 ГБ видеопамяти или растет параллельная нагрузка, конфигурацию нужно пересчитать.

2 GPU: несколько ИИ-сервисов или более высокая параллельная нагрузка

Для двух ускорителей можно рассмотреть Supermicro AS-2015CS-TNR с двумя NVIDIA L40S по 48 ГБ. Платформа поддерживает до двух двухслотовых GPU и использует один процессор AMD EPYC 9004 или 9005.

Пример конфигурации:

  • Supermicro AS-2015CS-TNR;
  • 2 × NVIDIA L40S 48 ГБ;
  • 1 × AMD EPYC серии 9004 или 9005;
  • 512 ГБ DDR5 RDIMM;
  • NVMe-накопители для моделей и рабочих данных.

Такой вариант подходит для нескольких внутренних ИИ-сервисов, нескольких экземпляров одной модели или нагрузки, которую нужно распределить между двумя ускорителями.

Платформа подключает GPU по PCIe 5.0 x16. Поэтому конкретную схему работы двух L40S нужно выбирать с учетом модели и используемого программного обеспечения.

4 GPU: крупная модель и интенсивная ИИ-нагрузка

Для четырех полноразмерных ускорителей можно использовать Dell PowerEdge R760xa с четырьмя NVIDIA H100 PCIe 80 ГБ. Платформа поддерживает до четырех H100.

Пример конфигурации:

  • Dell PowerEdge R760xa;
  • 4 × NVIDIA H100 PCIe 80 ГБ;
  • 2 × Intel Xeon Scalable;
  • 1 ТБ DDR5 RDIMM;
  • NVMe-накопители для моделей, наборов данных и рабочих файлов.

Такую конфигурацию можно рассматривать для крупных моделей, дообучения и сервисов с высокой параллельной нагрузкой.

Четыре H100 дают значительно больше вычислительных ресурсов, поэтому перед выбором такой сборки важно рассчитать реальную нагрузку. Для части локальных проектов возможности платформы будут избыточны.

Как выбрать между этими вариантами

Примеры показывают три разных класса конфигураций. Сравнивать их только по числу GPU нельзя. В одном проекте ограничением станет видеопамять, в другом — производительность при одновременной работе пользователей, в третьем — ресурсы для дообучения модели.

Поэтому готовую сборку выбирают после расчета нагрузки. Примеры выше помогают понять, как могут выглядеть серверы с одной, двумя и четырьмя GPU под разные сценарии.

Вопросы и ответы

Можно, если платформа поддерживает каждую карту по размерам, питанию и охлаждению. Для одной общей задачи чаще удобнее одинаковые ускорители, потому что их проще равномерно загрузить.

Да, для локального запуска моделей, тестов и разработки игровые GPU подходят. Для серверной эксплуатации нужно проверить совместимость с шасси, питание, охлаждение и допустимый режим работы.

Можно, если модель поддерживает работу на CPU. Но производительность обычно будет ниже, поэтому такой вариант чаще подходит для небольших моделей и тестовых сценариев.

Не обязательно. После установки модели и программного обеспечения вычисления могут выполняться внутри локальной инфраструктуры. Интернет может понадобиться для загрузки моделей, обновлений или внешних сервисов.

Можно, если серверу хватает ресурсов на обе задачи. При этом нужно учитывать общую нагрузку на CPU, RAM, накопители и GPU, чтобы дообучение не мешало рабочему сервису.

Да, существуют платформы на 8 GPU и больше. Но это уже другой класс систем с более высокими требованиями к питанию, охлаждению и внутренним соединениям.


#Серверы
#ИИ
0 комментариев
CRABBIT
ваш проводник в мире IT
Раз в неделю - дайджест материалов, достойных внимания
Другие статьи
#IT-инфраструктура
14 августа 2026
DHCP: что это, как работает протокол и зачем он нужен
При подключении нового устройства к сети ему нужны IP-адрес и другие параметры для обмена данными. Вручную задавать их на каждом компьютере, телефоне или сетевом устройстве неудобно, особенно если в инфраструктуре десятки или сотни узлов. Подробнее...
CRABBIT
#ИИ
26 июня 2026
Энергопотребление GPU-кластера в ЦОДе: что проверить перед закупкой ИИ-серверов

Компания планирует создать GPU‑кластер для машинного обучения? Если проверить только спецификацию серверов, можно получить дорогую конфигурацию, которая упирается не в вычисления, а в площадку.

Подробнее...
CRABBIT
#IT-инфраструктура #СХД
18 марта 2026
Подключение сервера к СХД: схемы, выбор и настройка для скорости и надежности
Подключение СХД по iSCSI или напрямую: схема выбора. Как обеспечить скорость, отказоустойчивость и не ошибиться в настройке.
Подробнее...
CRABBIT
#Кибербезопасность
12 августа 2026
Какие средства информационной безопасности нужны бизнесу в 2026 году
В статье разберем основные классы средств информационной безопасности и задачи, которые они решают. Покажем решения для разных сценариев. Объясним, как определить приоритеты защиты и не переплачивать за ненужные сервисы. Подробнее...
CRABBIT
#IT-инфраструктура
3 октября 2025
Мониторинг серверов и их нагрузки: как сделать и какие есть инструменты для контроля работы оборудования?
Серверный парк требует контроля. Рассказываем, какие инструменты мониторинга помогают выявлять сбои и прогнозировать нагрузки. Подробнее...
CRABBIT
#Серверы #IT-инфраструктура
14 сентября 2026
ECC-память: что это, как работает и зачем нужна
Ошибки в оперативной памяти могут проявляться сбоями программ, повреждением данных или нестабильной работой системы. В серверной инфраструктуре последствия таких ошибок особенно важны, поэтому при выборе памяти учитывают поддержку ECC. Подробнее...
CRABBIT
#IT-инфраструктура
20 августа 2026
Периферийные устройства компьютера: виды и принцип работы
Разберем, какие устройства относят к компьютерной периферии, как их классифицируют и по какому принципу они работают. Отдельно рассмотрим способы подключения и отличия от комплектующих компьютера. Подробнее...
CRABBIT
#Автоматизация #IT-инфраструктура
31 августа 2026
Файловая система: что это, как работает и какие бывают виды
От файловой системы зависит, сможет ли операционная система корректно работать с данными на накопителе. Разберем, как файловая система организует данные, какие варианты используются на практике и чем они отличаются. Подробнее...
CRABBIT
#Серверы
20 марта 2026
Huawei FusionServer в 2026: Кому подходят эти решения и почему они экономят бюджет
Рынок серверного оборудования в 2026 году диктует жёсткие условия: нужна максимальная производительность за разумные деньги. Мы видим, как решения Huawei FusionServer всё чаще становятся основой дата-центров и корпоративных сетей. В этом материале наши инженеры разобрали актуальные модели 2288H V5, V6 и 1288H V5, чтобы вы точно знали, какой сервер окупится именно в вашем проекте.
Подробнее...
CRABBIT
#Серверы #Обзор
2 октября 2026
Как выбрать сервер Dell PowerEdge под задачу: серии, поколения и модели
В статье разберем устройство линейки, различия между поколениями и модели для 1С, виртуализации, баз данных, файловых сервисов, резервного копирования и GPU-нагрузок. Отдельно рассмотрим параметры конфигурации, которые важно проверить перед заказом сервера. Подробнее...
CRABBIT
0 комментариев