[docs] fix prometheus node cpu alert rule (#11309)
Ilya Mashchenko committed
Jul 2, 2021 at 14:25 UTC
8b78803a4edbb52764f5d2ade7c11c2d746545a1
2 files changed
+68
-68
backends/prometheus/README.md
+34
-34
@@ -131,40 +131,40 @@ add a _- "nodes.yml"_ entry under the _rule_files:_ section in the example prome
131
132
```yaml
133
groups:
134
-- name: nodes
135
-
136
- rules:
137
- - alert: node_high_cpu_usage_70
138
- expr: avg(rate(netdata_cpu_cpu_percentage_average{dimension="idle"}[1m])) by (job) > 70
139
- for: 1m
140
- annotations:
141
- description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
142
- summary: CPU alert for container node '{{ $labels.job }}'
143
-
144
- - alert: node_high_memory_usage_70
145
- expr: 100 / sum(netdata_system_ram_MB_average) by (job)
146
- * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
147
- for: 1m
148
- annotations:
149
- description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
150
- summary: Memory alert for container node '{{ $labels.job }}'
151
-
152
- - alert: node_low_root_filesystem_space_20
153
- expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
154
- * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
155
- for: 1m
156
- annotations:
157
- description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
158
- summary: Root filesystem alert for container node '{{ $labels.job }}'
159
-
160
- - alert: node_root_filesystem_fill_rate_6h
161
- expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
162
- for: 1h
163
- labels:
164
- severity: critical
165
- annotations:
166
- description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
167
- summary: Disk fill alert for Swarm node '{{ $labels.job }}'
134
+ - name: nodes
135
+
136
+ rules:
137
+ - alert: node_high_cpu_usage_70
138
+ expr: sum(sum_over_time(netdata_system_cpu_percentage_average{dimension=~"(user|system|softirq|irq|guest)"}[10m])) by (job) / sum(count_over_time(netdata_system_cpu_percentage_average{dimension="idle"}[10m])) by (job) > 70
139
+ for: 1m
140
+ annotations:
141
+ description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
142
+ summary: CPU alert for container node '{{ $labels.job }}'
143
+
144
+ - alert: node_high_memory_usage_70
145
+ expr: 100 / sum(netdata_system_ram_MB_average) by (job)
146
+ * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
147
+ for: 1m
148
+ annotations:
149
+ description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
150
+ summary: Memory alert for container node '{{ $labels.job }}'
151
+
152
+ - alert: node_low_root_filesystem_space_20
153
+ expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
154
+ * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
155
+ for: 1m
156
+ annotations:
157
+ description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
158
+ summary: Root filesystem alert for container node '{{ $labels.job }}'
159
+
160
+ - alert: node_root_filesystem_fill_rate_6h
161
+ expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
162
+ for: 1h
163
+ labels:
164
+ severity: critical
165
+ annotations:
166
+ description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
167
+ summary: Disk fill alert for Swarm node '{{ $labels.job }}'
168
```
169
170
#### Install prometheus.service
exporting/prometheus/README.md
+34
-34
@@ -134,40 +134,40 @@ add a _- "nodes.yml"_ entry under the _rule_files:_ section in the example prome
134
135
```yaml
136
groups:
137
-- name: nodes
138
-
139
- rules:
140
- - alert: node_high_cpu_usage_70
141
- expr: avg(rate(netdata_cpu_cpu_percentage_average{dimension="idle"}[1m])) by (job) > 70
142
- for: 1m
143
- annotations:
144
- description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
145
- summary: CPU alert for container node '{{ $labels.job }}'
146
-
147
- - alert: node_high_memory_usage_70
148
- expr: 100 / sum(netdata_system_ram_MB_average) by (job)
149
- * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
150
- for: 1m
151
- annotations:
152
- description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
153
- summary: Memory alert for container node '{{ $labels.job }}'
154
-
155
- - alert: node_low_root_filesystem_space_20
156
- expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
157
- * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
158
- for: 1m
159
- annotations:
160
- description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
161
- summary: Root filesystem alert for container node '{{ $labels.job }}'
162
-
163
- - alert: node_root_filesystem_fill_rate_6h
164
- expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
165
- for: 1h
166
- labels:
167
- severity: critical
168
- annotations:
169
- description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
170
- summary: Disk fill alert for Swarm node '{{ $labels.job }}'
137
+ - name: nodes
138
+
139
+ rules:
140
+ - alert: node_high_cpu_usage_70
141
+ expr: sum(sum_over_time(netdata_system_cpu_percentage_average{dimension=~"(user|system|softirq|irq|guest)"}[10m])) by (job) / sum(count_over_time(netdata_system_cpu_percentage_average{dimension="idle"}[10m])) by (job) > 70
142
+ for: 1m
143
+ annotations:
144
+ description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
145
+ summary: CPU alert for container node '{{ $labels.job }}'
146
+
147
+ - alert: node_high_memory_usage_70
148
+ expr: 100 / sum(netdata_system_ram_MB_average) by (job)
149
+ * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
150
+ for: 1m
151
+ annotations:
152
+ description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
153
+ summary: Memory alert for container node '{{ $labels.job }}'
154
+
155
+ - alert: node_low_root_filesystem_space_20
156
+ expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
157
+ * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
158
+ for: 1m
159
+ annotations:
160
+ description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
161
+ summary: Root filesystem alert for container node '{{ $labels.job }}'
162
+
163
+ - alert: node_root_filesystem_fill_rate_6h
164
+ expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
165
+ for: 1h
166
+ labels:
167
+ severity: critical
168
+ annotations:
169
+ description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
170
+ summary: Disk fill alert for Swarm node '{{ $labels.job }}'
171
```
172
173
#### Install prometheus.service