С 2022 года Сингапур служит нашим хабом в Азиатско-Тихоокеанском регионе (APAC) для VPS и выделенных серверов. С сегодняшнего дня здесь есть и GPU-мощности: узлы H100 SXM и серверы RTX 4090 по тем же месячным ценам, что во Франкфурте и Нью-Йорке, и с теми же шаблонами. Причина — задержка, а задержка важна для GPU из-за инференса.
Что доступно
- H100 SXM 80 GB, конфигурации с одной картой и 2×, с 256 GB и 512 GB оперативной памяти хоста.
- RTX 4090 24 GB, с одной картой — для генерации изображений, дообучения небольших моделей и рендеринга.
- Все шаблоны из формы заказа: vLLM, TGI, Ollama, PyTorch, ComfyUI, JupyterLab и остальные — на Ubuntu 24.04 с CUDA 12 и актуальным драйвером.
Остатки, как всегда, честные: числа на странице с ценами — это свободный пул, а «распродано» означает именно распродано, а не «спросите нас».
Почему задержка важна для инференса
Ответ чат-модели (chat completion) передаётся потоком токенов по мере генерации, и пользователь сталкивается с двумя задержками: временем до первого токена и сетевым RTT на каждый фрагмент. Из Токио, Сиднея или Мумбаи модель, развёрнутая во Франкфурте, добавляет от 200 до 280 ms RTT до появления первого токена, и каждый последующий фрагмент несёт ту же задержку. Та же модель в Сингапуре находится в 50–90 ms от этих городов. Для интерактивного продукта это разница между ответом, который воспринимается как «живой», и ответом, который ощущается как загрузка страницы.
Требования к размещению данных (data residency) указывают в ту же сторону. Клиентам, обслуживающим Сингапур, Индонезию, Индию или Австралию, часто нужно, чтобы модель и промпты оставались в регионе, а GPU во Франкфурте этому требованию не удовлетворяет, какой бы быстрой она ни была.
Цены
Те же, что на остальных площадках. Правило ценообразования сравнивает каждый тариф с самым дешёвым надёжным провайдером для того же оборудования, и в APAC такое сравнение даёт более высокое число, чем в Европе; мы всё равно берём европейскую цену, потому что клиент должен выбирать локацию исходя из своих пользователей, а не из нашей структуры затрат.
Хаб вокруг GPU-серверов
Сингапур участвует в пиринге на точке обмена Equinix и подключён к трём транзитным провайдерам — по той же схеме, что Франкфурт и Нью-Йорк. Мощности для очистки DDoS-трафика (scrubbing) расположены локально. Looking Glass показывает пути, а в руководстве по выбору локации приведены значения RTT до городов, важных для продуктов в APAC.
Что дальше
Серверы с RTX 5090 появятся, как только карты пройдут тот же прогон под нагрузкой (burn-in), что и франкфуртская партия. Более крупные конфигурации H100 — 4× и 8× — придут с очередным расширением зала; если они нужны вам раньше, тикет с указанием ваших сроков позволит получить прямой ответ.
