案例解读丨中国某保险公司IT运维管理平台建设(架构篇)
17866乐维将搭建一个支持多功能插入、可横向扩展的完整架构,实现纵向对系统管理员、部门领导、企业领导等决策层的多层次监控展现。
View details热门搜索 企业动态 新闻中心 成功案例 社区 Prometheus交流区
该科学园是集科研实验、企业办公、配套服务于一体的产业园区,园区内部部署大规模华为IT基础设施,涵盖防火墙、漏洞扫描、交换机、路由器、无线AC控制器、大量AP接入点,承载园区科研业务网络、办公无线网络、边界安全防护等核心业务,网络与安全基础设施的稳定直接关系园内科研工作正常开展。
随着园区信息化规模不断扩大,网络、安全、无线设备数量持续增长,原有分散式运维模式的短板逐步暴露:多套设备管理系统相互独立,缺乏统一监控底座,运维工作依赖人工操作,故障发现滞后、排查效率低,已经难以匹配园区高可靠的业务运行要求,因此亟需建设一套智能监控平台,实现园区IT基础设施集中监控运维。
园区安全、网络、无线设备种类多、数量大,原有运维体系存在多处现实难题,严重威胁业务连续性:
园区安全、网络、无线设备分属不同管理入口,防火墙、交换机、路由器、无线AC/AP、漏洞扫描设备各自独立管理。运维人员需要频繁切换多套管理系统查看设备状态,无法统一审视整套IT基础设施运行态势。
园区各类华为安全、网络、无线设备原生监控指标口径不一致,部分设备指标冗余、关键运行指标缺失。运维人员需要记忆不同设备的查看逻辑,很难横向对比同类设备运行状态。
没有集中可视化监控平台,基础设施运行状态无法直观呈现。设备性能瓶颈、链路异常、AP掉线等隐患无法提前预警,往往要等到用户反馈网络卡顿、业务访问异常后,运维才知晓故障。
日常运维主要依靠人工逐台登录设备巡检,工作量大,容易发生漏检。一旦发生网络中断、大面积无线故障,缺少统一告警与数据支撑,需逐台设备排查问题,故障定位为小时级,对科研、办公业务造成较大风险。
各设备自带告警规则参差不齐,部分告警阈值过于敏感,产生大量无效重复告警;部分设备告警等级定义错误,次要事件标记为高危告警。海量告警淹没是真正重大故障,运维人员很难筛选有效风险。
结合上述业务痛点,园区运维团队提出一体化监控建设诉求:
针对园区业务场景,智能监控平台通过协议适配、告警治理、专项视图建设,针对性解决全部痛点,具体落地能力如下:
平台基于SNMP、API协议对华为防火墙、漏洞扫描设备、交换机、路由器、无线AC控制器、AP做深度监控适配,无需开发复杂自定义脚本,设备即可快速接入监控平台。
提供统一设备资产列表,集中展示所有被监控设备的IP、业务归属、运行状态,运维人员在单一页面即可总览全部设备在线情况,解决多系统来回切换的问题。
价值:实现资产统一台账,全局掌握设备存活状态,告别分散管理。

平台提供完整告警规则配置能力,支持自定义告警级别、告警描述、过滤条件。针对华为设备原生告警过于敏感、等级错乱的问题,运维人员可以按需调整告警等级,配置告警过滤规则,过滤重复告警、低风险干扰告警。
同时支持按设备分组(路由器、交换机、防火墙、安全设备)配置差异化告警策略,针对不同设备类型设置不同通知策略;告警发生、告警恢复均可配置邮件等通知渠道,定向推送给对应运维管理员。
价值:消除告警风暴,只输出有效风险告警,确保真正故障能够被运维人员及时捕捉。

针对园区大量无线AC、AP设备,打造无线专项监控面板。实时采集AP监控状态、在线状态、IP地址、在线终端数量、MAC地址、运行时长等核心数据,直观展示AP在线率、接入用户规模、无线信号质量。
运维人员可以快速发现离线AP、接入异常点位,不用逐台登录AC控制器查看,快速定位无线网络故障点,保障园区办公、科研区域无线网络体验。

乐维社区已经开放乐维运维智能体免费版,欢迎下载使用!

乐维将搭建一个支持多功能插入、可横向扩展的完整架构,实现纵向对系统管理员、部门领导、企业领导等决策层的多层次监控展现。
View details机房设备品牌繁杂,人工巡检效率低、故障发现滞后。乐维运维监控系统通过预制模板、SNMP自动采集、分组规划,实现IBM、戴尔、浪潮等服务器统一管理。实时采集...
View detailsIT监控系统的工程监工、医院以及银行安全等方面发挥的功能是十分巨大,其中一项就是可以监控可以活动,从而降低其发生率
View details
HelloPlease log in