GPU-серверы

Образы для GPU с CUDA и драйверами, Docker с NVIDIA toolkit, шаблоны фреймворков, частные VLAN и многоузловое обучение на GPU-серверах CheapServ.

GPU-серверы дают вам полноценный физический GPU NVIDIA, проброшенный в вашу машину: он никогда не делится с другими клиентами и никогда не работает в режиме разделения по времени (time-slicing), а драйвер и CUDA toolkit уже предустановлены. В этом руководстве перечислены тарифы, описано содержимое образов, показано, как проверить GPU и запускать контейнеры, а также рассмотрена сеть между узлами.

Тарифы

GPUVRAMВ месяцПримечания
RTX 409024 GB GDDR6X$259Инференс, дообучение, рендеринг
RTX 509032 GB GDDR7$449Самая быстрая карта потребительского класса
L40S48 GB GDDR6$539Инференс, графика, видео
A10080 GB HBM2e$789Обучение, большие модели
H100 SXM80 GB HBM3$97932 vCPU, 256 GB ОЗУ, 2 TB NVMe, 10 Gbps
H200141 GB HBM3e$1,559Наибольший объём памяти на один GPU
8× H100 SXM640 GB HBM3$9,300Bare metal, 192 vCPU, 2 TB ОЗУ, 30 TB NVMe, 25 Gbps

Тарифы с одним GPU — это виртуальные машины, в которые GPU подключён через PCIe passthrough; узел 8× H100 — это bare metal с NVLink между картами. Оплата только помесячная, по одной и той же цене во всех GPU-локациях: Франкфурт, Амстердам, Нью-Йорк и Сингапур. Актуальное наличие указано на странице GPU; распроданные карты возвращаются в продажу по мере освобождения узлов.

Образы и драйверы

Образ по умолчанию — Ubuntu 24.04 с актуальным драйвером NVIDIA из production-ветки и CUDA 12.8. Ubuntu 22.04 поставляется с CUDA 12.4 для более старых тулчейнов. Rocky Linux 9 и Debian 12 доступны с установленным драйвером; Windows Server 2025 (лицензия включена) можно запросить для тарифов RTX через тикет.

Приложения в один клик для Ubuntu 24.04: PyTorch, TensorFlow, JupyterLab, Ollama, vLLM, стек Hugging Face (transformers, accelerate, datasets) и Docker с NVIDIA container toolkit. Каждое приложение устанавливается в отдельное виртуальное окружение или контейнер и не изменяет системный драйвер.

Вы можете самостоятельно установить другой драйвер или другую версию CUDA. В этом случае заблокируйте обновление пакетов, которые мы поставляем, чтобы автоматическое обновление не заменило их:

apt-mark hold nvidia-driver-570 cuda-toolkit-12-8

Проверка GPU

После первого входа убедитесь, что карта видна, а драйвер загружен:

nvidia-smi
nvcc --version

nvidia-smi показывает модель GPU, версию драйвера, используемый объём VRAM и запущенные процессы. Если выводится сообщение No devices were found, перезагрузите сервер один раз — проброшенное устройство инициализируется при первой загрузке после развёртывания, — а если проблема не исчезнет, откройте тикет.

Включите persistence mode, чтобы драйвер не инициализировался заново между задачами, а тактовые частоты фиксируйте, только если вашей нагрузке нужно детерминированное время выполнения:

nvidia-smi -pm 1

Docker и контейнеры

Если вы используете приложение Docker в один клик, NVIDIA container toolkit уже настроен. Запустите контейнер CUDA и проверьте, что он видит GPU:

docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi

На обычном образе установите toolkit из репозитория NVIDIA, а затем зарегистрируйте runtime:

apt-get install -y nvidia-container-toolkit
nvidia-ctk runtime configure --runtime=docker
systemctl restart docker

Для Kubernetes приложение k3s в один клик вместе с NVIDIA device plugin предоставляет карту как ресурс nvidia.com/gpu.

Быстрая проверка PyTorch

Приложение PyTorch устанавливает сборку с поддержкой CUDA в /opt/pytorch/venv. Активируйте окружение и запустите короткий бенчмарк, чтобы убедиться, что работу выполняет GPU:

source /opt/pytorch/venv/bin/activate
python - <<'EOF'
import torch, time
print(torch.cuda.get_device_name(0), torch.version.cuda)
x = torch.randn(8192, 8192, device='cuda', dtype=torch.float16)
torch.cuda.synchronize(); t = time.time()
for _ in range(20): y = x @ x
torch.cuda.synchronize(); print(f"{20*2*8192**3/(time.time()-t)/1e12:.1f} TFLOPS fp16")
EOF

Для этого наивного цикла умножения матриц ожидайте примерно 150 TFLOPS на RTX 4090, 250 на L40S и более 600 на H100 SXM; точные значения зависят от тактовых частот и лимитов мощности.

Сеть между узлами

GPU-узлы в одной локации входят в общую частную сеть (VLAN) на втором интерфейсе со скоростью до 25 Gbps; эта сеть безлимитна и изолирована от других клиентов. Используйте её для хранения датасетов на Storage VPS или выделенном сервере, для серверов параметров или для обучения на нескольких узлах с NCCL поверх TCP. Для узла 8× H100 по запросу можно включить RDMA over Converged Ethernet (RoCE) для коллективных операций с меньшей задержкой.

Минимальный запуск PyTorch на двух узлах по частной сети:

torchrun --nnodes=2 --nproc_per_node=1 --node_rank=0 \
  --master_addr=10.0.0.11 --master_port=29500 train.py

Публичная полоса на GPU-узлах безлимитная: 10 Gbps на тарифах H100 и H200, 25 Gbps на узле 8× H100, 1 Gbps на тарифах RTX, L40S и A100.

Переход на более мощный GPU

Закажите новый узел, скопируйте данные по частной сети с помощью rsync, затем отмените старый. Неиспользованная часть месяца старого узла зачисляется на ваш баланс. Для GPU-тарифов снапшоты недоступны, поэтому храните датасеты и чекпоинты на отдельном томе или сервере, который можно подключить заново.

Чего-то не хватает или на странице есть ошибка? Сообщите нам: Открыть тикет.