热点
数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态,reasoning_content:我们要求以主机运维者的口吻,写一个与“技术、科技”相关,关于[数码浪潮驱动物联网创新:塑造移动互联新生态]的标题要求简短精炼,30字以内注意口吻是主机运维者,可能是一种技术运维人员的视角标题需要体现数码浪潮、物联网创新、移动互联新生态建议使用第一人称或运维者常见表达,比如“我”、“运维者”、“守护者”等可以尝试:“数码浪潮中,我驱动物联网创新,重塑移动互联生态”但需要更精炼或者:“主机运维者:数码浪潮驱动物联网,塑造移动互联新生态”但字数可能超尝试:“运维者的数码浪潮:驱动IoT创新,塑造移动互联新生态”但需要控制在30字内更简洁:“数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态”共19字?数一下:数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态 —— 共18个汉字?等等:数码(2)浪潮(2):(1)主机(2)运维者(3)驱动(2)物联网(3)创新(2),(1)塑造(2)移动(2)互联(2)新(1)生态(2) 总共2+2+1+2+3+2+3+2+1+2+2+2+1+2=27字可以但标点算不算?通常不严格也可以去掉冒号:“数码浪潮中主机运维者驱动物联网创新塑造移动互联新生态”但听起来像句子更合适:“主机运维者:数码浪潮驱动物联网,塑造移动互联新生态” 共18字左右或者使用第一人称:“我驱动物联网创新,在数码浪潮中塑造移动互联新生态” 但有点长最终选择:“数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态” 27字,符合要求
大数据驱动:实时处理精准优化信息流实战,reasoning_content:我们要求以技术培训师的口吻,写一个与“技术、科技”相关,关于“大数据驱动:实时高效处理,精准优化信息流”的标题直接输出一个标题,不要加说明,字数30字以内nn技术培训师的口吻:通常比较专业、清晰、有教学感,可能包含“实战”、“技能”、“掌握”、“解析”等词汇结合大数据驱动、实时高效处理、精准优化信息流nn尝试几个:n1. “大数据实时处理:实战精优信息流技术”n2. “掌握大数据驱动:实时高效优化信息流”n3. “大数据精准信息流:实时处理高效实战”n4. “技术培训:大数据驱动精准优化信息流”nn注意30字以内第四个17个字但需要更精炼,且口吻更像培训师第一个“实战精优”有点别扭第二个“掌握”不错第三个“实战”也行nn最好直接:大数据驱动:实时高效处理,精准优化信息流但这是题目本身,需要加个培训师口吻的标题比如“大数据驱动:实时处理精准优化信息流实战” 16字或者“大数据实时处理实战:精准优化信息流” 16字nn再想一个:大数据驱动信息流:实时处理与精准优化但缺少培训感加“技能”:“大数据驱动信息流实时处理与精准优化技能” 18字nn或者“【培训】大数据驱动:实时高效精准优化信息流” 18字但方括号可能多余nn最终选一个简洁的:大数据驱动:实时处理精准优化信息流实战共15字符合要求
用户调研:视觉赋能物联网,开启新视野,reasoning_content:我们要求以用户调研专员的口吻写一个与技术、科技相关,关于[计算机视觉赋能物联网:开启移动互联新视野]的标题需要简短精炼,30字以内直接输出标题,不要加说明nn用户调研专员的口吻应该是从用户调研的角度,可能强调用户需求、体验、洞察等例如:用户眼中的计算机视觉如何重塑物联网体验之类的但需要更精炼nn考虑:计算机视觉赋能物联网,开启移动互联新视野主题是技术赋能作为用户调研专员,可以从用户视角出发比如:调研发现:计算机视觉让物联网更懂你 但不够直接nn或者:用户调研:计算机视觉如何解锁物联网新视界 字数较多nn更简洁:视觉赋能物联网,用户新体验 但不够准确nn尝试:用户调研:视觉赋能物联网,开启新视野 字数13nn或者:从用户视角看计算机视觉赋能物联网 字数14nn注意原标题是计算机视觉赋能物联网:开启移动互联新视野,我们需保留核心意思可以用用户调研:计算机视觉让物联网’看见’移动互联新可能 但字数可能超nn尽量控制在20字内最佳: 用户调研:视觉赋能物联网,开启新视野 12字但新视野原指移动互联新视野,可以保留nn考虑到用户调研专员的口吻,可以加调研二字最终输出:用户调研:视觉赋能物联网,开启新视野 去掉引号
Linux视觉数据库:安全配置与性能优化指南,reasoning_content:我们要求以大模型安全工程师的口吻,写一个与技术、科技相关,关于[Linux下计算机视觉环境搭建:数据库配置与性能优化指南]的标题直接输出一个标题,不要加说明提示等信息简短精炼,字数控制在30字以内nn需要体现大模型安全工程师的视角,可能强调安全、性能优化、环境搭建等标题要包含Linux、计算机视觉、数据库配置、性能优化等元素注意口吻:专业、技术性nn可能的 Linux视觉环境:数据库安全配置与性能优化 但需要更精炼或者 大模型安全视角:Linux视觉环境数据库优化 但字数控制nn尝试: Linux视觉环境:数据库安全配置与性能调优 字数12+?实际计数:Linux视觉环境:数据库安全配置与性能调优(12个汉字+冒号?共13字)或者 大模型安全工程师:Linux视觉数据库配置优化 16字nn更贴合: 安全视角:Linux计算机视觉数据库优化 13字但要求以大模型安全工程师口吻,最好在标题中体现身份或视角但标题本身不需要写“大模型安全工程师”字样,而是口吻可以考虑“安全审计:Linux视觉环境数据库配置与性能优化”但超30字?数一下:安全审计:Linux视觉环境数据库配置与性能优化(18字)可以nn另一种: Linux视觉数据库:安全配置与性能优化指南 14字还可以nn注意要求直接输出一个标题,不要加说明我选择一个简短有力的
17 9 月 2026, 周四

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

副标题#e#

在上一篇文章【一篇运维老司机的大数据平台监控宝典(1)】中,我们介绍了目前联通大数据监控平台由Grafana+Influxdb+Prometheus+Alertmanager等组件组成,并且着重详述了以Grafana为核心的图形化展示功能。

本文继续针对运维监控体系的另一重要内容,即告警分析、处理及发送功能进行分享。

一、为什么要选择Prometheus+Alertmanager

你的监控系统是否曾面临这些痛点:

  • 告警信息推送无法分类,无法针对某部分人进行特定告警
  • 重复告警或无用告警过多,重要告警易被埋没
  • 监控系统无法提供可视化展示,或仅能部分展示
  • 监控历史数据不能二次查询或多维度查询,故障排查缺少依据

对于业务量、平台主机量级较大的公司来说,使用以nagios+ganglia为首的传统的监控平台往往会遇到以上情况,显得力不从心。经过大量、丰富的实战工作后,我们最后选择Prometheus+Alertmanager+钉钉的搭配作为联通大数据监控平台的告警分析、处理及发送工具组合。这套组合不仅能够针对以上痛点一一解决,也可以说是运维人员保障集群平台稳定运行、故障排查、问题定位的一把利器。

在下面的章节中,笔者会对系统中的Prometheus、Alertmanager等组件逐一进行介绍。

二、Prometheus-数据存储及分析

1. Prometheus简介

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

基于上图,大家可以清晰的看到,Prometheus实际上是一个tsdb型数据库,所有的采集数据以metric的形式保存在其中,且能够将数据落到本地磁盘中,供使用人员二次查询数据。

Prometheus同时附加了强大的计算与分析功能,能够利用各种labels与promql语句来完成多维度的监控数据查询,从而为故障排查与问题定位提供可靠的证据。

监控规则方面,Prometheus可以根据promql来获取数据,并且与固定阈值进行计算比较,若超出正常范围,则标记为告警信息,并且可以分组分标签定义告警描述,供后续Alertmanager使用。

在拓展性方面,Prometheus可以轻松的完成服务发现功能,并拥有每秒上万数据点的监控数据收集与分析的处理能力,完全摆脱了传统监控系统对监控主机数量的要求。目前联通大数据平台机器几千余台,监控实例过十万,监控实例指标过千万,Prometheus优良的性能可以做到完美支撑。

2. Prometheus特点

(1) 监控数据存储功能及多维度查询

下图中以一个简单例子说明:该条查询可以看到某集群接口机15分钟内的系统负载,涉及到的标签维度为集群、主机IP、主机类型等。在实际线上环境中,还可以添加多个标签来完成查询,并且可以利用promql特有的查询语句(sum、count_values、topk等)来完成更加丰富的多维度查询,提供可靠、便捷、直观的监控数据供运维人员使用。

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

(2) 优秀的自定义及第三方监控拓展功能

Pushgateway是Prometheus环境中的一个data_collector。把它定义为采集者的原因很简单,标准的Prometheus会采用pull模式从target中获取监控数据,但当由于外力原因(如网络、硬件等)无法直接从target中拉取数据时,就要依靠Pushgateway了,请看下图:

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

大致流程为client上部署的脚本(支持多语言shell、python等)会收集target中的数据,并且以metric形式传送到Pushgateway中,只要保证client和Pushgateway能够正常通信即可。Prometheus会按照配置时间,定时到Pushgateway上拉取监控数据,从而达到收集target的目的。

下图为Pushgetway发送数据的代码过程:

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

那么是否可以这么理解:对于常见组件(redis、mysql、nginx、haproxy等),我们可以依靠现有的丰富client库,直接进行监控纳管;对于一些特殊组件或自定义业务,可通过多语言脚本采集监控数据或业务埋点方式,把Pushgateway作为一个data_collector来收集各方数据,从而完成监控纳管。

(3) 良好的监控生态圈之常见client库

由于近年Prometheus的兴起,开源社区中越来越多的人将自己的代码贡献出来,使得Prometheus拥有庞大的client库(redis、mysql、nginx、haproxy等),运维人员可以利用这些client实现即开即用即监控的功能。

3. 配置

  1. global: 
  2. scrape_interval: 15s 
  3. evaluation_interval: 15s 
  4. # scrape_timeout is set to the global default (10s). 
  5.  
  6. # Alertmanager configuration 
  7. alerting: 
  8. alertmanagers: 
  9. - static_configs: 
  10. - targets: ['IP:9093'] 
  11.  
  12. rule_files:   
  13. # - "first_rules.yml" 
  14. # - "second_rules.yml" 
  15.  
  16. # A scrape configuration containing exactly one endpoint to scrape: 
  17. - job_name: 'prometheus' 
  18.     scrape_interval: 15s   
  19. static_configs: 
  20.  - targets: ['localdns:9090'] 

三、Alertmanager-告警的分类搬运工

1. Alertmanager简介

Alertmanager在监控系统中的定位是接收Prometheus发送来的告警,并逐一按照配置中route进行分类,并且通过silencing、inhibition的规则计算,最终得到有效告警信息,通过邮件、钉钉、微信等方式发送给各类业务人群。

2. Alertmanager特点

(1) 分组

#p#副标题#e#

可以用一个业务场景来解释该特点:某大数据集群由于网络问题大面积瘫痪,上百个datanode触发断开告警,如果按照传统监控模式的话,收到的将是上百条的告警短信形成短信轰炸。但如果使用分组特性,Alertmanager会将具有共同属性的告警归为一条发送到接收端,清晰明了。

(2) 抑制

还是用业务场景来解释该特点:某主机上运行了一个mysql实例,若该主机宕机,则会收到多条关于mysql各项监控的告警信息,但如果配置了抑制用法,只要触发该主机的宕机告警,上面mysql所触发的告警便会被抑制掉。

(3) 沉默

举例来说,某主机硬件主板损坏,但厂商反馈要2天后才能更换主板,一般情况下在更换主板前,该警报会一直大量重复发送。如果此时利用沉默功能,在页面上配置沉默选项即可暂停此告警,待修复完成后取消沉默规则即可。

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

3. 配置

  1. global: 
  2.   resolve_timeout: 5m 
  3. templates: 
  4.   - 'template/*.tmpl'                 
  5. route: 
  6.   group_by: ['cluster'] 
  7.   group_wait: 10s                
  8.   group_interval: 20s                            
  9.   repeat_interval: 30m         
  10.   receiver: 'host'                   
  11.  
  12.   routes: 
  13. ###############example#################### 
  14.   - receiver: 'example' 
  15.     match: 
  16.       cluster: example 
  17.     continue: true 
  18. - name: 'example' 
  19.   webhook_configs: 
  20.   - url: 'http://localhost:8180/dingtalk/ops_dingding/send' 
  21.  
  22. inhibit_rules:                         
  23.   - source_match: 
  24.   - source_match_re: 
  25.     target_match_re: 
  26.            equal: ['ipAddress'] 

四、钉钉-最终告警接收查阅

#p#副标题#e##p#分页标题#e#

运维人员常用的发送告警工具有短信、邮件、企业微信和钉钉,之所以选择钉钉的原因如下:

  • 短信:一般是通过往oracle插入告警信息走短信网关发送;优点是及时高效,但缺点是oracle支持的并发量有限。
  • 邮件:邮件告警的及时性是一个很大的问题,并且如果没有合理设置阈值,邮件轰炸会影响其他工作邮件的阅读。
  • 企业微信:企业微信不存在短信网关的并发限制,但弊端在于告警条数有限。
  • 钉钉:有强大的分组功能且不限制告警条数;可按项目创建告警群,也方便解除。

使用钉钉作为告警接收工具,简单来说就是在钉钉群聊中配置机器人,每个机器人会有一条唯一的webhook,当接收到来自Alertmanager的告警后就可以发送到手机端。本文不再详述钉钉机器人的配置,感兴趣的同学可以自行到网上查阅资料。

五、补充知识点

作为运维人员,做得最多的工作就是日常巡检、故障恢复。公司集群规模越庞大,故障发生率和故障实例数也会成倍增加,相信每个运维人都体会过节假日被临时召唤修复故障的经历。这里,笔者额外贡献一条“自动化恢复”小贴士,解放随时等待召唤的运维er,你值得拥有:

自动化简易流程:通过采集分析Prometheus里的告警数据,利用fabric或ansible等多线程安全并发远程连接工具,执行相关角色实例的恢复工作。

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

Fabric建立连接执行恢复命令。

一篇运维老司机的大数据平台监控宝典(2)-联通大数据集群平台监控体系详解

目前自动化恢复涉及的集群日常运维操作有:

  • 计算节点检测出使用swap交换分区,将会自动清理swap分区,并关闭swap分区。
  • 计算节点检测出时钟偏差,将会自动纠偏时钟偏差。
  • cloudera manager代理挂掉,将会自动重启。
  • 主机检测出有坏盘,坏盘更换完成后,自动恢复。
  • 角色实例检测出异常掉线,自动恢复上线。
  • 集群存在多个节点多块磁盘存储剩余空间不足,自动进行磁盘级别的数据balancer。
  • 集群存储达到阈值,自动进行节点级别的数据balancer。

需要提示的是,自动化恢复的适用场景很多,但并不适用于罕见故障且该故障有一定概率会影响到平台部分功能性能的情况,建议大家使用前严谨权衡、对症下药。

【本文是51CTO专栏机构中国联通大数据的原创文章,微信公众号“中国联通大数据( id: unibigdata)”】

戳这里,看该作者更多好文

#p#副标题#e#

【编辑推荐】

  1. Puppet自动化集群管理基础篇
  2. 让前端监控数据采集更高效
  3. 深入浅出百亿请求高可用Redis(codis)分布式集群揭秘
  4. 运维监控的终极秘籍,盘它!
  5. 一篇运维老司机的大数据平台监控宝典(1)-联通大数据集群平台监控体系进程详解

【责任编辑:赵宁宁 TEL:(010)68476606】
点赞 0

dawei

【声明】:北京站长网内容转载自互联网,其相关言论仅代表作者个人观点绝非权威,不代表本站立场。如您发现内容存在版权问题,请提交相关链接至邮箱:bqsm@foxmail.com,我们将及时予以处理。

您错过了

数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态,reasoning_content:我们要求以主机运维者的口吻,写一个与“技术、科技”相关,关于[数码浪潮驱动物联网创新:塑造移动互联新生态]的标题要求简短精炼,30字以内注意口吻是主机运维者,可能是一种技术运维人员的视角标题需要体现数码浪潮、物联网创新、移动互联新生态建议使用第一人称或运维者常见表达,比如“我”、“运维者”、“守护者”等可以尝试:“数码浪潮中,我驱动物联网创新,重塑移动互联生态”但需要更精炼或者:“主机运维者:数码浪潮驱动物联网,塑造移动互联新生态”但字数可能超尝试:“运维者的数码浪潮:驱动IoT创新,塑造移动互联新生态”但需要控制在30字内更简洁:“数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态”共19字?数一下:数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态 —— 共18个汉字?等等:数码(2)浪潮(2):(1)主机(2)运维者(3)驱动(2)物联网(3)创新(2),(1)塑造(2)移动(2)互联(2)新(1)生态(2) 总共2+2+1+2+3+2+3+2+1+2+2+2+1+2=27字可以但标点算不算?通常不严格也可以去掉冒号:“数码浪潮中主机运维者驱动物联网创新塑造移动互联新生态”但听起来像句子更合适:“主机运维者:数码浪潮驱动物联网,塑造移动互联新生态” 共18字左右或者使用第一人称:“我驱动物联网创新,在数码浪潮中塑造移动互联新生态” 但有点长最终选择:“数码浪潮:主机运维者驱动物联网创新,塑造移动互联新生态” 27字,符合要求

大数据驱动:实时处理精准优化信息流实战,reasoning_content:我们要求以技术培训师的口吻,写一个与“技术、科技”相关,关于“大数据驱动:实时高效处理,精准优化信息流”的标题直接输出一个标题,不要加说明,字数30字以内nn技术培训师的口吻:通常比较专业、清晰、有教学感,可能包含“实战”、“技能”、“掌握”、“解析”等词汇结合大数据驱动、实时高效处理、精准优化信息流nn尝试几个:n1. “大数据实时处理:实战精优信息流技术”n2. “掌握大数据驱动:实时高效优化信息流”n3. “大数据精准信息流:实时处理高效实战”n4. “技术培训:大数据驱动精准优化信息流”nn注意30字以内第四个17个字但需要更精炼,且口吻更像培训师第一个“实战精优”有点别扭第二个“掌握”不错第三个“实战”也行nn最好直接:大数据驱动:实时高效处理,精准优化信息流但这是题目本身,需要加个培训师口吻的标题比如“大数据驱动:实时处理精准优化信息流实战” 16字或者“大数据实时处理实战:精准优化信息流” 16字nn再想一个:大数据驱动信息流:实时处理与精准优化但缺少培训感加“技能”:“大数据驱动信息流实时处理与精准优化技能” 18字nn或者“【培训】大数据驱动:实时高效精准优化信息流” 18字但方括号可能多余nn最终选一个简洁的:大数据驱动:实时处理精准优化信息流实战共15字符合要求

用户调研:视觉赋能物联网,开启新视野,reasoning_content:我们要求以用户调研专员的口吻写一个与技术、科技相关,关于[计算机视觉赋能物联网:开启移动互联新视野]的标题需要简短精炼,30字以内直接输出标题,不要加说明nn用户调研专员的口吻应该是从用户调研的角度,可能强调用户需求、体验、洞察等例如:用户眼中的计算机视觉如何重塑物联网体验之类的但需要更精炼nn考虑:计算机视觉赋能物联网,开启移动互联新视野主题是技术赋能作为用户调研专员,可以从用户视角出发比如:调研发现:计算机视觉让物联网更懂你 但不够直接nn或者:用户调研:计算机视觉如何解锁物联网新视界 字数较多nn更简洁:视觉赋能物联网,用户新体验 但不够准确nn尝试:用户调研:视觉赋能物联网,开启新视野 字数13nn或者:从用户视角看计算机视觉赋能物联网 字数14nn注意原标题是计算机视觉赋能物联网:开启移动互联新视野,我们需保留核心意思可以用用户调研:计算机视觉让物联网’看见’移动互联新可能 但字数可能超nn尽量控制在20字内最佳: 用户调研:视觉赋能物联网,开启新视野 12字但新视野原指移动互联新视野,可以保留nn考虑到用户调研专员的口吻,可以加调研二字最终输出:用户调研:视觉赋能物联网,开启新视野 去掉引号