节点故障导致扩展延迟
所有受影响的模型目前已经正常运行超过30分钟,且未发现残留的预测队列。感谢您的耐心等待!
原文All affected models have been scaling correctly for more than 30 minutes at this point, and we see no residual prediction queues. Thank you for your patience!
扩展决策延迟了近1小时,原因是负责发出队列指标的控制器未能在软故障节点上调度。我们已对该节点进行隔离并排空,控制器现已重新发出队列指标。
原文Scaling decisions were delayed by nearly 1 hour after the controller responsible for emitting queue metrics failed to schedule on a soft-failed node. We have since cordoned and drained the node, and the controller is emitting queue metrics again.
关于这些数据
Replicate的故障事件数据从哪来?
全部来自Replicate 官方状态页的公开接口,由本站每 5 分钟同步一次,保留最近 90 天。事件标题、时间、影响级别与更新记录均为官方原文,本站不做改写;点详情页底部的链接可回到厂商原始记录核对。
顶部的组件状态条怎么看?
每一格是一天,绿色表示Replicate 官方状态页当天未记录异常,黄色表示部分降级,红色表示当天有较大故障,灰色表示该组件当时还没有数据。右侧的可用率是官方口径的 90 天统计,与状态总览页显示的是同一份数据。
为什么有的服务查不到历史?
本页只收录对外提供官方状态页的服务。没有公开状态页的厂商(多数国产大模型属于此类)无法取得可信数据,本站不做自建拨测去猜,因此也不会出现在状态总览里。
持续时长怎么算?
按官方标注的开始时间到恢复时间计算;尚未恢复的事件按「至今」计算并标为进行中。跨天的事件在状态条上会覆盖它经过的每一天。
完整的服务清单与实时状态见状态总览。