GPU 服务器

预装 CUDA 与驱动的 GPU 镜像、配好 NVIDIA 工具包的 Docker、框架模板,以及 CheapServ GPU 服务器上的私有 VLAN 和多节点训练。

GPU 服务器为您提供一块完整的物理 NVIDIA GPU,直通给您的机器使用——从不共享,也从不做时间切片——并预装驱动和 CUDA 工具包。本指南列出各个套餐,说明镜像包含哪些内容,演示如何验证 GPU 和运行容器,并介绍节点之间的网络。

套餐

GPU显存月费备注
RTX 409024 GB GDDR6X$259推理、微调、渲染
RTX 509032 GB GDDR7$449速度最快的消费级显卡
L40S48 GB GDDR6$539推理、图形、视频
A10080 GB HBM2e$789训练、大模型
H100 SXM80 GB HBM3$97932 vCPU、256 GB 内存、2 TB NVMe、10 Gbps
H200141 GB HBM3e$1,559单卡显存最大
8× H100 SXM640 GB HBM3$9,300裸金属,192 vCPU、2 TB 内存、30 TB NVMe、25 Gbps

单 GPU 套餐是通过 PCIe 直通挂载 GPU 的虚拟机;8× H100 节点是裸金属服务器,卡与卡之间通过 NVLink 互联。仅支持按月计费,所有 GPU 机房位置价格相同:法兰克福、阿姆斯特丹、纽约和新加坡。实时库存见 GPU 页面;已售罄的显卡会在节点空出后重新上架。

镜像与驱动

默认镜像为 Ubuntu 24.04,预装当前的 NVIDIA 生产分支驱动和 CUDA 12.8。Ubuntu 22.04 镜像附带 CUDA 12.4,供较旧的工具链使用。也提供已安装驱动的 Rocky Linux 9 和 Debian 12;RTX 套餐还可通过工单申请 Windows Server 2025(含许可证)。

Ubuntu 24.04 上的一键应用有:PyTorch、TensorFlow、JupyterLab、Ollama、vLLM、Hugging Face 工具栈(transformers、accelerate、datasets),以及预装 NVIDIA 容器工具包的 Docker。每个应用都安装在独立的虚拟环境或容器中,不会修改系统驱动。

您也可以自行安装其他版本的驱动或 CUDA。如果这样做,请锁定我们预装的软件包版本,以免无人值守升级将其替换:

apt-mark hold nvidia-driver-570 cuda-toolkit-12-8

验证 GPU

首次登录后,请确认显卡可见、驱动已加载:

nvidia-smi
nvcc --version

nvidia-smi 会列出 GPU 型号、驱动版本、已用显存和正在运行的进程。如果它报告 No devices were found,请重启一次——直通设备会在开通后的首次启动时完成初始化——如果问题依然存在,请提交工单。

启用持久模式,避免驱动在两次任务之间重新初始化;只有当您的工作负载需要确定性的耗时表现时,才需要锁定时钟频率:

nvidia-smi -pm 1

Docker 与容器

使用 Docker 一键应用时,NVIDIA 容器工具包已配置完毕。运行一个 CUDA 容器,确认它能看到 GPU:

docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi

在普通镜像上,请从 NVIDIA 的软件仓库安装该工具包,然后注册运行时:

apt-get install -y nvidia-container-toolkit
nvidia-ctk runtime configure --runtime=docker
systemctl restart docker

对于 Kubernetes,使用 k3s 一键应用加上 NVIDIA 设备插件,即可把显卡作为 nvidia.com/gpu 资源暴露出来。

PyTorch 快速检查

PyTorch 应用会在 /opt/pytorch/venv 中安装支持 CUDA 的版本。激活该环境并运行一个简短的基准测试,确认确实是 GPU 在执行计算:

source /opt/pytorch/venv/bin/activate
python - <<'EOF'
import torch, time
print(torch.cuda.get_device_name(0), torch.version.cuda)
x = torch.randn(8192, 8192, device='cuda', dtype=torch.float16)
torch.cuda.synchronize(); t = time.time()
for _ in range(20): y = x @ x
torch.cuda.synchronize(); print(f"{20*2*8192**3/(time.time()-t)/1e12:.1f} TFLOPS fp16")
EOF

对于这个朴素的矩阵乘法循环,预期 RTX 4090 上约为 150 TFLOPS,L40S 上约为 250,H100 SXM 上则超过 600;具体数值取决于时钟频率和功耗上限。

节点间网络

同一机房位置的 GPU 节点通过第二个网络接口共享一个私有 VLAN,速率最高 25 Gbps,不限流量,并与其他客户隔离。您可以用它访问存放在存储型 VPS 或独立服务器上的数据集、搭建参数服务器,或进行基于 TCP 的 NCCL 多节点训练。8× H100 节点可应请求启用基于融合以太网的 RDMA(RoCE),以获得延迟更低的集合通信操作。

通过私有网络启动双节点 PyTorch 的最简示例:

torchrun --nnodes=2 --nproc_per_node=1 --node_rank=0 \
  --master_addr=10.0.0.11 --master_port=29500 train.py

GPU 节点的公网带宽不限流量:H100 和 H200 套餐为 10 Gbps,8× H100 节点为 25 Gbps,RTX、L40S 和 A100 套餐为 1 Gbps。

迁移到更大的 GPU

先订购新节点,通过私有网络用 rsync 复制数据,再取消旧节点。旧节点当月未使用的部分会计入您的余额。GPU 套餐不提供快照,因此请把数据集和检查点保存在可以重新挂载的独立卷或服务器上。

本页有遗漏或错误?提交工单,告诉我们。