@cryptotaxi247 / netdata-1 / commits / 8b78803a4

[docs] fix prometheus node cpu alert rule (#11309)

Ilya Mashchenko committed Jul 2, 2021 at 14:25 UTC 8b78803a4edbb52764f5d2ade7c11c2d746545a1
2 files changed +68 -68
backends/prometheus/README.md
+34 -34
@@ -131,40 +131,40 @@ add a _- "nodes.yml"_ entry under the _rule_files:_ section in the example prome
131
132 ```yaml
133 groups:
134 -- name: nodes
135 -
136 - rules:
137 - - alert: node_high_cpu_usage_70
138 - expr: avg(rate(netdata_cpu_cpu_percentage_average{dimension="idle"}[1m])) by (job) > 70
139 - for: 1m
140 - annotations:
141 - description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
142 - summary: CPU alert for container node '{{ $labels.job }}'
143 -
144 - - alert: node_high_memory_usage_70
145 - expr: 100 / sum(netdata_system_ram_MB_average) by (job)
146 - * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
147 - for: 1m
148 - annotations:
149 - description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
150 - summary: Memory alert for container node '{{ $labels.job }}'
151 -
152 - - alert: node_low_root_filesystem_space_20
153 - expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
154 - * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
155 - for: 1m
156 - annotations:
157 - description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
158 - summary: Root filesystem alert for container node '{{ $labels.job }}'
159 -
160 - - alert: node_root_filesystem_fill_rate_6h
161 - expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
162 - for: 1h
163 - labels:
164 - severity: critical
165 - annotations:
166 - description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
167 - summary: Disk fill alert for Swarm node '{{ $labels.job }}'
134 + - name: nodes
135 +
136 + rules:
137 + - alert: node_high_cpu_usage_70
138 + expr: sum(sum_over_time(netdata_system_cpu_percentage_average{dimension=~"(user|system|softirq|irq|guest)"}[10m])) by (job) / sum(count_over_time(netdata_system_cpu_percentage_average{dimension="idle"}[10m])) by (job) > 70
139 + for: 1m
140 + annotations:
141 + description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
142 + summary: CPU alert for container node '{{ $labels.job }}'
143 +
144 + - alert: node_high_memory_usage_70
145 + expr: 100 / sum(netdata_system_ram_MB_average) by (job)
146 + * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
147 + for: 1m
148 + annotations:
149 + description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
150 + summary: Memory alert for container node '{{ $labels.job }}'
151 +
152 + - alert: node_low_root_filesystem_space_20
153 + expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
154 + * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
155 + for: 1m
156 + annotations:
157 + description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
158 + summary: Root filesystem alert for container node '{{ $labels.job }}'
159 +
160 + - alert: node_root_filesystem_fill_rate_6h
161 + expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
162 + for: 1h
163 + labels:
164 + severity: critical
165 + annotations:
166 + description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
167 + summary: Disk fill alert for Swarm node '{{ $labels.job }}'
168 ```
169
170 #### Install prometheus.service
exporting/prometheus/README.md
+34 -34
@@ -134,40 +134,40 @@ add a _- "nodes.yml"_ entry under the _rule_files:_ section in the example prome
134
135 ```yaml
136 groups:
137 -- name: nodes
138 -
139 - rules:
140 - - alert: node_high_cpu_usage_70
141 - expr: avg(rate(netdata_cpu_cpu_percentage_average{dimension="idle"}[1m])) by (job) > 70
142 - for: 1m
143 - annotations:
144 - description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
145 - summary: CPU alert for container node '{{ $labels.job }}'
146 -
147 - - alert: node_high_memory_usage_70
148 - expr: 100 / sum(netdata_system_ram_MB_average) by (job)
149 - * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
150 - for: 1m
151 - annotations:
152 - description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
153 - summary: Memory alert for container node '{{ $labels.job }}'
154 -
155 - - alert: node_low_root_filesystem_space_20
156 - expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
157 - * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
158 - for: 1m
159 - annotations:
160 - description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
161 - summary: Root filesystem alert for container node '{{ $labels.job }}'
162 -
163 - - alert: node_root_filesystem_fill_rate_6h
164 - expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
165 - for: 1h
166 - labels:
167 - severity: critical
168 - annotations:
169 - description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
170 - summary: Disk fill alert for Swarm node '{{ $labels.job }}'
137 + - name: nodes
138 +
139 + rules:
140 + - alert: node_high_cpu_usage_70
141 + expr: sum(sum_over_time(netdata_system_cpu_percentage_average{dimension=~"(user|system|softirq|irq|guest)"}[10m])) by (job) / sum(count_over_time(netdata_system_cpu_percentage_average{dimension="idle"}[10m])) by (job) > 70
142 + for: 1m
143 + annotations:
144 + description: '{{ $labels.job }} on ''{{ $labels.job }}'' CPU usage is at {{ humanize $value }}%.'
145 + summary: CPU alert for container node '{{ $labels.job }}'
146 +
147 + - alert: node_high_memory_usage_70
148 + expr: 100 / sum(netdata_system_ram_MB_average) by (job)
149 + * sum(netdata_system_ram_MB_average{dimension=~"free|cached"}) by (job) < 30
150 + for: 1m
151 + annotations:
152 + description: '{{ $labels.job }} memory usage is {{ humanize $value}}%.'
153 + summary: Memory alert for container node '{{ $labels.job }}'
154 +
155 + - alert: node_low_root_filesystem_space_20
156 + expr: 100 / sum(netdata_disk_space_GB_average{family="/"}) by (job)
157 + * sum(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}) by (job) < 20
158 + for: 1m
159 + annotations:
160 + description: '{{ $labels.job }} root filesystem space is {{ humanize $value}}%.'
161 + summary: Root filesystem alert for container node '{{ $labels.job }}'
162 +
163 + - alert: node_root_filesystem_fill_rate_6h
164 + expr: predict_linear(netdata_disk_space_GB_average{family="/",dimension=~"avail|cached"}[1h], 6 * 3600) < 0
165 + for: 1h
166 + labels:
167 + severity: critical
168 + annotations:
169 + description: Container node {{ $labels.job }} root filesystem is going to fill up in 6h.
170 + summary: Disk fill alert for Swarm node '{{ $labels.job }}'
171 ```
172
173 #### Install prometheus.service