自 2022 年起,新加坡就是我们面向亚太地区的 VPS 和独立服务器枢纽。从今天起,它也开始提供 GPU 库存:H100 SXM 节点和 RTX 4090 服务器,月付价格与法兰克福和纽约相同,模板也一样。原因是延迟,而延迟之所以对 GPU 重要,是因为推理。
提供哪些配置
- H100 SXM 80 GB,提供单卡和 2× 配置,可选 256 GB 或 512 GB 主机内存。
- RTX 4090 24 GB,单卡,适用于图像生成、小模型微调和渲染。
- 下单表单中的全部模板:vLLM、TGI、Ollama、PyTorch、ComfyUI、JupyterLab 等,均基于 Ubuntu 24.04,并预装 CUDA 12 和当前版本的驱动。
库存一如既往地诚实:定价页面上的数字就是空闲的库存池,“已售罄”就是真的售罄,而不是“请咨询我们”。
延迟为什么对推理很重要
聊天补全会在生成 token 的同时以流式方式把它们推送出来,用户会感受到两种延迟:首 token 延迟,以及每个数据块上的网络往返时延。从东京、悉尼或孟买访问部署在法兰克福的模型,在第一个 token 出现之前就要多出 200 到 280 ms 的往返时延,之后每个数据块也都带着同样的延迟。同一个模型如果部署在新加坡,到这些城市只需 50 到 90 ms。对交互式产品来说,这就是“响应像是实时生成”和“响应像是在加载一个网页”之间的差别。
数据驻留的要求也指向同一个方向。服务新加坡、印度尼西亚、印度或澳大利亚的客户,往往需要让模型和提示词留在本区域内,而法兰克福的 GPU 无论速度多快,都满足不了这一点。
价格
与其他节点完全相同。定价规则会把每个套餐与同类硬件上最便宜的可信服务商做比较,而在亚太,这一比较得出的数字比欧洲更高;但我们依然按欧洲的价格收费,因为客户选择机房位置,应该是为了他们的用户,而不是为了迎合我们的成本结构。
GPU 周边的枢纽配套
新加坡节点在 Equinix 交换中心做对等互联,并接入三家 transit 服务商,设计与法兰克福和纽约相同。DDoS 清洗容量部署在本地。Looking Glass 可以查看路径,机房位置选择指南则给出了到亚太产品最关心的那些城市的往返时延数据。
接下来
RTX 5090 库存会在这批显卡通过与法兰克福那一批相同的老化测试后随即上架。更大规格的 H100 配置(4× 和 8×)将随机房大厅的下一轮扩建一起到来;如果您在那之前就需要,请提交一张说明时间要求的工单,我们会给您一个直截了当的答复。
