来源:中国能源新闻网 时间:2026-09-14 18:43
中国能源新闻网讯(罗坤)近期,国网江西电力为强化数据中台实时链路主动运维能力,围绕Kafka集群日均承载百亿级实时数据写入、200TB级数据读写,聚焦实时链路异常感知不及时、故障恢复依赖人工、故障影响数据高可用等问题,构建实时链路监测、自愈恢复和故障磁盘副本迁移回切机制,推动运维由人工巡检、被动处置向自动感知、主动运维转变,提升实时数据传输稳定性、连续性和运维效率。
攻坚克难,聚焦难点问题解决。一是实时链路状态感知不及时。业务侧对中断敏感性高,传统人工巡检缺乏主动精准的健康探测能力,数据延迟问题往往在业务侧感知后才被动发现。二是实时链路异常恢复处置效率低。链路卡死或中断后需人工登录集群排查并重启任务,故障期间易产生数据积压,延迟消除需数小时,极端情况下存在数据丢失风险。三是Kafka集群磁盘故障影响数据高可用。集群磁盘IO长期高负载,设备老化导致慢盘、坏盘增多,磁盘故障后分区高可用能力下降,若处置不及时并叠加其他异常,可能存在数据丢失的风险。
充分验证,保障平台稳定运行。一是建立实时链路任务异常监测机制。打通华为云原生计算任务调度接口,分钟级轮询实时任务状态,引入“双周期校验”和异常状态判断规则,实现运行状态自动感知,推动运维模式由人工巡检向自动监测转变,为链路自愈提供决策依据。二是完善实时链路异常研判与自动恢复机制。针对140余条核心实时数据链路,构建“首次研判、二次校核、主动恢复”自动化处置流程,系统发现异常后二次校核,确认持续异常后自动执行任务终止、重启及状态恢复确认,将人工干预转为系统自动执行,由小时级链路恢复缩短至分钟级,减少数据积压,提升链路平稳性。三是建立故障磁盘副本迁移与回切机制。针对Kafka集群磁盘故障后topic分区高可用能力下降的问题,运维人员确认磁盘告警后查询异常topic分区并获取分区清单,通过与华为联合研发的程序自动生成分区迁移脚本和回迁脚本,运维人员核实后将异常分区自动迁移至健康磁盘,及时恢复双副本状态,通过迁移过程中自定义迁移速率,控制磁盘IO消耗,减少对HBase、DWS及业务实时数据处理等下游业务影响,故障磁盘更换后再执行分区回迁,避免数据倾斜,保障平台平稳运行。
责任编辑:高慧君