‹ 返回事件历史

节点故障导致扩展延迟

原文Delayed scaling due to node failure
已恢复轻微故障Replicate
2026年8月11日星期二 03:45 ~ 2026年8月11日星期二 05:08(1 小时 23 分钟)
受影响组件
Inference and Training / H100 Hardware
Inference and Training / L40S Hardware
更新记录
已恢复2026年8月11日星期二 05:45

所有受影响的模型目前已经正常运行超过30分钟,且未发现残留的预测队列。感谢您的耐心等待!

原文All affected models have been scaling correctly for more than 30 minutes at this point, and we see no residual prediction queues. Thank you for your patience!

监控中2026年8月11日星期二 05:05

扩展决策延迟了近1小时,原因是负责发出队列指标的控制器未能在软故障节点上调度。我们已对该节点进行隔离并排空,控制器现已重新发出队列指标。

原文Scaling decisions were delayed by nearly 1 hour after the controller responsible for emitting queue metrics failed to schedule on a soft-failed node. We have since cordoned and drained the node, and the controller is emitting queue metrics again.

事件内容来自 Replicate 官方状态页:查看官方原文。中文由 AI 翻译,仅供快速理解,以官方英文原文为准。

关于这些数据

事件从哪来?

全部来自各厂商官方状态页的公开接口,由本站每 5 分钟同步一次,保留最近 90 天。事件标题、时间、影响级别与更新记录均为官方原文,本站不做改写;点详情页底部的链接可回到厂商原始记录核对。

为什么有的服务查不到历史?

本页只收录对外提供官方状态页的服务。没有公开状态页的厂商(多数国产大模型属于此类)无法取得可信数据,本站不做自建拨测去猜,因此也不会出现在状态总览里。

持续时长怎么算?

按官方标注的开始时间到恢复时间计算;尚未恢复的事件按「至今」计算并标为进行中。跨天的事件在状态条上会覆盖它经过的每一天。