master
conf 207 lines 7.43 KB
Raw
1 # you can disable an alarm notification by setting the 'to' line to: silent
2
3 # --- API Server ---
4
5 template: am_aks_apiserver_cpu
6 on: azure_monitor.aks.apiserver_cpu
7 class: Utilization
8 type: Kubernetes
9 component: AKS
10 lookup: average -5m unaligned of average
11 units: percentage
12 every: 1m
13 warn: $this > (($status >= $WARNING) ? (75) : (80))
14 crit: $this > (($status == $CRITICAL) ? (85) : (95))
15 delay: down 5m multiplier 1.5 max 1h
16 summary: AKS API server CPU on ${label:resource_name}
17 info: Average API server CPU utilization on AKS cluster ${label:resource_name} \
18 in ${label:resource_group} (${label:region})
19 to: sysadmin
20
21 template: am_aks_apiserver_memory
22 on: azure_monitor.aks.apiserver_memory
23 class: Utilization
24 type: Kubernetes
25 component: AKS
26 lookup: average -5m unaligned of average
27 units: percentage
28 every: 1m
29 warn: $this > (($status >= $WARNING) ? (75) : (80))
30 crit: $this > (($status == $CRITICAL) ? (85) : (95))
31 delay: down 5m multiplier 1.5 max 1h
32 summary: AKS API server memory on ${label:resource_name}
33 info: Average API server memory utilization on AKS cluster ${label:resource_name} \
34 in ${label:resource_group} (${label:region})
35 to: sysadmin
36
37 template: am_aks_apiserver_inflight_requests
38 on: azure_monitor.aks.apiserver_inflight_requests
39 class: Workload
40 type: Kubernetes
41 component: AKS
42 lookup: average -5m unaligned of average
43 units: requests
44 every: 1m
45 warn: $this > (($status >= $WARNING) ? (400) : (600))
46 crit: $this > (($status == $CRITICAL) ? (600) : (800))
47 delay: down 5m multiplier 1.5 max 1h
48 summary: AKS API server inflight requests on ${label:resource_name}
49 info: Average number of inflight requests to the API server on AKS cluster ${label:resource_name} \
50 in ${label:resource_group} (${label:region})
51 to: sysadmin
52
53 # --- etcd ---
54
55 template: am_aks_etcd_cpu
56 on: azure_monitor.aks.etcd_cpu
57 class: Utilization
58 type: Kubernetes
59 component: AKS
60 lookup: average -5m unaligned of average
61 units: percentage
62 every: 1m
63 warn: $this > (($status >= $WARNING) ? (75) : (80))
64 crit: $this > (($status == $CRITICAL) ? (85) : (95))
65 delay: down 5m multiplier 1.5 max 1h
66 summary: AKS etcd CPU on ${label:resource_name}
67 info: Average etcd CPU utilization on AKS cluster ${label:resource_name} \
68 in ${label:resource_group} (${label:region})
69 to: sysadmin
70
71 template: am_aks_etcd_memory
72 on: azure_monitor.aks.etcd_memory
73 class: Utilization
74 type: Kubernetes
75 component: AKS
76 lookup: average -5m unaligned of average
77 units: percentage
78 every: 1m
79 warn: $this > (($status >= $WARNING) ? (75) : (80))
80 crit: $this > (($status == $CRITICAL) ? (85) : (95))
81 delay: down 5m multiplier 1.5 max 1h
82 summary: AKS etcd memory on ${label:resource_name}
83 info: Average etcd memory utilization on AKS cluster ${label:resource_name} \
84 in ${label:resource_group} (${label:region})
85 to: sysadmin
86
87 template: am_aks_etcd_database
88 on: azure_monitor.aks.etcd_database
89 class: Utilization
90 type: Kubernetes
91 component: AKS
92 lookup: average -5m unaligned of average
93 units: percentage
94 every: 1m
95 warn: $this > (($status >= $WARNING) ? (75) : (80))
96 crit: $this > (($status == $CRITICAL) ? (85) : (90))
97 delay: down 5m multiplier 1.5 max 1h
98 summary: AKS etcd database usage on ${label:resource_name}
99 info: Average etcd database utilization on AKS cluster ${label:resource_name} \
100 in ${label:resource_group} (${label:region}). \
101 High etcd database usage can lead to cluster instability.
102 to: sysadmin
103
104 # --- Autoscaler ---
105
106 template: am_aks_autoscaler_safe_to_autoscale
107 on: azure_monitor.aks.autoscaler_health
108 class: Availability
109 type: Kubernetes
110 component: AKS
111 lookup: average -5m unaligned of safe_to_autoscale
112 units: state
113 every: 1m
114 warn: $this != nan AND $this < 1
115 delay: down 5m multiplier 1.5 max 1h
116 summary: AKS autoscaler unsafe on ${label:resource_name}
117 info: Cluster autoscaler reports the cluster is not safe to autoscale on AKS cluster ${label:resource_name} \
118 in ${label:resource_group} (${label:region})
119 to: sysadmin
120
121 template: am_aks_autoscaler_unschedulable_pods
122 on: azure_monitor.aks.autoscaler_unschedulable_pods
123 class: Errors
124 type: Kubernetes
125 component: AKS
126 lookup: average -5m unaligned of average
127 units: pods
128 every: 1m
129 warn: $this > (($status >= $WARNING) ? (0) : (5))
130 crit: $this > (($status == $CRITICAL) ? (5) : (20))
131 delay: down 5m multiplier 1.5 max 1h
132 summary: AKS unschedulable pods on ${label:resource_name}
133 info: Number of pods that cannot be scheduled by the cluster autoscaler on AKS cluster ${label:resource_name} \
134 in ${label:resource_group} (${label:region}). \
135 Indicates insufficient cluster capacity.
136 to: sysadmin
137
138 # --- Node CPU ---
139
140 template: am_aks_node_cpu
141 on: azure_monitor.aks.node_cpu_percentage
142 class: Utilization
143 type: Kubernetes
144 component: AKS
145 lookup: average -5m unaligned of average
146 units: percentage
147 every: 1m
148 warn: $this > (($status >= $WARNING) ? (80) : (90))
149 crit: $this > (($status == $CRITICAL) ? (90) : (95))
150 delay: down 5m multiplier 1.5 max 1h
151 summary: AKS node CPU on ${label:resource_name}
152 info: Average node CPU utilization on AKS cluster ${label:resource_name} \
153 in ${label:resource_group} (${label:region})
154 to: sysadmin
155
156 # --- Node Memory ---
157
158 template: am_aks_node_memory_working_set
159 on: azure_monitor.aks.node_memory_working_set_percentage
160 class: Utilization
161 type: Kubernetes
162 component: AKS
163 lookup: average -5m unaligned of average
164 units: percentage
165 every: 1m
166 warn: $this > (($status >= $WARNING) ? (80) : (85))
167 crit: $this > (($status == $CRITICAL) ? (85) : (95))
168 delay: down 5m multiplier 1.5 max 1h
169 summary: AKS node memory working set on ${label:resource_name}
170 info: Average node memory working set utilization on AKS cluster ${label:resource_name} \
171 in ${label:resource_group} (${label:region})
172 to: sysadmin
173
174 template: am_aks_node_memory_rss
175 on: azure_monitor.aks.node_memory_rss_percentage
176 class: Utilization
177 type: Kubernetes
178 component: AKS
179 lookup: average -5m unaligned of average
180 units: percentage
181 every: 1m
182 warn: $this > (($status >= $WARNING) ? (80) : (85))
183 crit: $this > (($status == $CRITICAL) ? (85) : (95))
184 delay: down 5m multiplier 1.5 max 1h
185 summary: AKS node memory RSS on ${label:resource_name}
186 info: Average node memory RSS utilization on AKS cluster ${label:resource_name} \
187 in ${label:resource_group} (${label:region})
188 to: sysadmin
189
190 # --- Node Disk ---
191
192 template: am_aks_node_disk
193 on: azure_monitor.aks.node_disk_percentage
194 class: Utilization
195 type: Kubernetes
196 component: AKS
197 lookup: average -5m unaligned of average
198 units: percentage
199 every: 1m
200 warn: $this > (($status >= $WARNING) ? (75) : (80))
201 crit: $this > (($status == $CRITICAL) ? (85) : (90))
202 delay: down 5m multiplier 1.5 max 1h
203 summary: AKS node disk usage on ${label:resource_name}
204 info: Average node disk utilization on AKS cluster ${label:resource_name} \
205 in ${label:resource_group} (${label:region}). \
206 High disk usage can cause pod evictions.
207 to: sysadmin