add rabbitmq alerts (#18972)
Ilya Mashchenko committed
Nov 8, 2024 at 17:26 UTC
572b54d4fc578294a6ce3bf9e2ec97936ed16731
2 files changed
+74
-1
src/go/plugin/go.d/modules/rabbitmq/metadata.yaml
+17
-1
@@ -169,7 +169,23 @@ modules:
169
troubleshooting:
170
problems:
171
list: []
172
- alerts: []
172
+ alerts:
173
+ - name: rabbitmq_node_avail_status_down
174
+ metric: rabbitmq.node_avail_status
175
+ info: RabbitMQ node is down (node ${label:node} cluster ${label:cluster_id})
176
+ link: https://github.com/netdata/netdata/blob/master/src/health/health.d/rabbitmq.conf
177
+ - name: rabbitmq_node_mem_alarm_status_triggered
178
+ metric: rabbitmq.node_mem_alarm_status
179
+ info: RabbitMQ mem alarm triggered (node ${label:node} cluster ${label:cluster_id})
180
+ link: https://github.com/netdata/netdata/blob/master/src/health/health.d/rabbitmq.conf
181
+ - name: rabbitmq.node_disk_free_alarm_status_triggered
182
+ metric: rabbitmq.node_disk_free_alarm_status
183
+ info: RabbitMQ disk free alarm triggered (node ${label:node} cluster ${label:cluster_id})
184
+ link: https://github.com/netdata/netdata/blob/master/src/health/health.d/rabbitmq.conf
185
+ - name: rabbitmq_vhost_status_unhealthy
186
+ metric: rabbitmq.vhost_status
187
+ info: RabbitMQ vhost is not healthy (vhost ${label:vhost} cluster ${label:cluster_id})
188
+ link: https://github.com/netdata/netdata/blob/master/src/health/health.d/rabbitmq.conf
189
metrics:
190
folding:
191
title: Metrics
src/health/health.d/rabbitmq.conf
new
+57
@@ -0,0 +1,57 @@
1
+# you can disable an alarm notification by setting the 'to' line to: silent
2
+
3
+ template: rabbitmq_node_avail_status_down
4
+ on: rabbitmq.node_avail_status
5
+ class: Errors
6
+ type: Messaging
7
+component: RabbitMQ
8
+ calc: $down
9
+ every: 10s
10
+ units: status
11
+ warn: $this > 0
12
+ summary: RabbitMQ node is down (node ${label:node} cluster ${label:cluster_id})
13
+ info: RabbitMQ node is down (node ${label:node} cluster ${label:cluster_id})
14
+ delay: down 1m
15
+ to: sysadmin
16
+
17
+ template: rabbitmq_node_mem_alarm_status_triggered
18
+ on: rabbitmq.node_mem_alarm_status
19
+ class: Errors
20
+ type: Messaging
21
+component: RabbitMQ
22
+ calc: $triggered
23
+ every: 10s
24
+ units: status
25
+ warn: $this > 0
26
+ summary: RabbitMQ mem alarm triggered (node ${label:node} cluster ${label:cluster_id})
27
+ info: RabbitMQ mem alarm triggered (node ${label:node} cluster ${label:cluster_id})
28
+ delay: down 1m
29
+ to: sysadmin
30
+
31
+ template: rabbitmq.node_disk_free_alarm_status_triggered
32
+ on: rabbitmq.node_disk_free_alarm_status
33
+ class: Errors
34
+ type: Messaging
35
+component: RabbitMQ
36
+ calc: $triggered
37
+ every: 10s
38
+ units: status
39
+ warn: $this > 0
40
+ summary: RabbitMQ disk free alarm triggered (node ${label:node} cluster ${label:cluster_id})
41
+ info: RabbitMQ disk free alarm triggered (node ${label:node} cluster ${label:cluster_id})
42
+ delay: down 1m
43
+ to: sysadmin
44
+
45
+ template: rabbitmq_vhost_status_unhealthy
46
+ on: rabbitmq.vhost_status
47
+ class: Errors
48
+ type: Messaging
49
+component: RabbitMQ
50
+ calc: $stopped + $partial
51
+ every: 10s
52
+ units: status
53
+ warn: $this > 0
54
+ summary: RabbitMQ vhost is not healthy (vhost ${label:vhost} cluster ${label:cluster_id})
55
+ info: RabbitMQ vhost is not healthy (vhost ${label:vhost} cluster ${label:cluster_id})
56
+ delay: down 1m
57
+ to: sysadmin