| 1 | # you can disable an alarm notification by setting the 'to' line to: silent |
| 2 | |
| 3 | # --- API Server --- |
| 4 | |
| 5 | template: am_aks_apiserver_cpu |
| 6 | on: azure_monitor.aks.apiserver_cpu |
| 7 | class: Utilization |
| 8 | type: Kubernetes |
| 9 | component: AKS |
| 10 | lookup: average -5m unaligned of average |
| 11 | units: percentage |
| 12 | every: 1m |
| 13 | warn: $this > (($status >= $WARNING) ? (75) : (80)) |
| 14 | crit: $this > (($status == $CRITICAL) ? (85) : (95)) |
| 15 | delay: down 5m multiplier 1.5 max 1h |
| 16 | summary: AKS API server CPU on ${label:resource_name} |
| 17 | info: Average API server CPU utilization on AKS cluster ${label:resource_name} \ |
| 18 | in ${label:resource_group} (${label:region}) |
| 19 | to: sysadmin |
| 20 | |
| 21 | template: am_aks_apiserver_memory |
| 22 | on: azure_monitor.aks.apiserver_memory |
| 23 | class: Utilization |
| 24 | type: Kubernetes |
| 25 | component: AKS |
| 26 | lookup: average -5m unaligned of average |
| 27 | units: percentage |
| 28 | every: 1m |
| 29 | warn: $this > (($status >= $WARNING) ? (75) : (80)) |
| 30 | crit: $this > (($status == $CRITICAL) ? (85) : (95)) |
| 31 | delay: down 5m multiplier 1.5 max 1h |
| 32 | summary: AKS API server memory on ${label:resource_name} |
| 33 | info: Average API server memory utilization on AKS cluster ${label:resource_name} \ |
| 34 | in ${label:resource_group} (${label:region}) |
| 35 | to: sysadmin |
| 36 | |
| 37 | template: am_aks_apiserver_inflight_requests |
| 38 | on: azure_monitor.aks.apiserver_inflight_requests |
| 39 | class: Workload |
| 40 | type: Kubernetes |
| 41 | component: AKS |
| 42 | lookup: average -5m unaligned of average |
| 43 | units: requests |
| 44 | every: 1m |
| 45 | warn: $this > (($status >= $WARNING) ? (400) : (600)) |
| 46 | crit: $this > (($status == $CRITICAL) ? (600) : (800)) |
| 47 | delay: down 5m multiplier 1.5 max 1h |
| 48 | summary: AKS API server inflight requests on ${label:resource_name} |
| 49 | info: Average number of inflight requests to the API server on AKS cluster ${label:resource_name} \ |
| 50 | in ${label:resource_group} (${label:region}) |
| 51 | to: sysadmin |
| 52 | |
| 53 | # --- etcd --- |
| 54 | |
| 55 | template: am_aks_etcd_cpu |
| 56 | on: azure_monitor.aks.etcd_cpu |
| 57 | class: Utilization |
| 58 | type: Kubernetes |
| 59 | component: AKS |
| 60 | lookup: average -5m unaligned of average |
| 61 | units: percentage |
| 62 | every: 1m |
| 63 | warn: $this > (($status >= $WARNING) ? (75) : (80)) |
| 64 | crit: $this > (($status == $CRITICAL) ? (85) : (95)) |
| 65 | delay: down 5m multiplier 1.5 max 1h |
| 66 | summary: AKS etcd CPU on ${label:resource_name} |
| 67 | info: Average etcd CPU utilization on AKS cluster ${label:resource_name} \ |
| 68 | in ${label:resource_group} (${label:region}) |
| 69 | to: sysadmin |
| 70 | |
| 71 | template: am_aks_etcd_memory |
| 72 | on: azure_monitor.aks.etcd_memory |
| 73 | class: Utilization |
| 74 | type: Kubernetes |
| 75 | component: AKS |
| 76 | lookup: average -5m unaligned of average |
| 77 | units: percentage |
| 78 | every: 1m |
| 79 | warn: $this > (($status >= $WARNING) ? (75) : (80)) |
| 80 | crit: $this > (($status == $CRITICAL) ? (85) : (95)) |
| 81 | delay: down 5m multiplier 1.5 max 1h |
| 82 | summary: AKS etcd memory on ${label:resource_name} |
| 83 | info: Average etcd memory utilization on AKS cluster ${label:resource_name} \ |
| 84 | in ${label:resource_group} (${label:region}) |
| 85 | to: sysadmin |
| 86 | |
| 87 | template: am_aks_etcd_database |
| 88 | on: azure_monitor.aks.etcd_database |
| 89 | class: Utilization |
| 90 | type: Kubernetes |
| 91 | component: AKS |
| 92 | lookup: average -5m unaligned of average |
| 93 | units: percentage |
| 94 | every: 1m |
| 95 | warn: $this > (($status >= $WARNING) ? (75) : (80)) |
| 96 | crit: $this > (($status == $CRITICAL) ? (85) : (90)) |
| 97 | delay: down 5m multiplier 1.5 max 1h |
| 98 | summary: AKS etcd database usage on ${label:resource_name} |
| 99 | info: Average etcd database utilization on AKS cluster ${label:resource_name} \ |
| 100 | in ${label:resource_group} (${label:region}). \ |
| 101 | High etcd database usage can lead to cluster instability. |
| 102 | to: sysadmin |
| 103 | |
| 104 | # --- Autoscaler --- |
| 105 | |
| 106 | template: am_aks_autoscaler_safe_to_autoscale |
| 107 | on: azure_monitor.aks.autoscaler_health |
| 108 | class: Availability |
| 109 | type: Kubernetes |
| 110 | component: AKS |
| 111 | lookup: average -5m unaligned of safe_to_autoscale |
| 112 | units: state |
| 113 | every: 1m |
| 114 | warn: $this != nan AND $this < 1 |
| 115 | delay: down 5m multiplier 1.5 max 1h |
| 116 | summary: AKS autoscaler unsafe on ${label:resource_name} |
| 117 | info: Cluster autoscaler reports the cluster is not safe to autoscale on AKS cluster ${label:resource_name} \ |
| 118 | in ${label:resource_group} (${label:region}) |
| 119 | to: sysadmin |
| 120 | |
| 121 | template: am_aks_autoscaler_unschedulable_pods |
| 122 | on: azure_monitor.aks.autoscaler_unschedulable_pods |
| 123 | class: Errors |
| 124 | type: Kubernetes |
| 125 | component: AKS |
| 126 | lookup: average -5m unaligned of average |
| 127 | units: pods |
| 128 | every: 1m |
| 129 | warn: $this > (($status >= $WARNING) ? (0) : (5)) |
| 130 | crit: $this > (($status == $CRITICAL) ? (5) : (20)) |
| 131 | delay: down 5m multiplier 1.5 max 1h |
| 132 | summary: AKS unschedulable pods on ${label:resource_name} |
| 133 | info: Number of pods that cannot be scheduled by the cluster autoscaler on AKS cluster ${label:resource_name} \ |
| 134 | in ${label:resource_group} (${label:region}). \ |
| 135 | Indicates insufficient cluster capacity. |
| 136 | to: sysadmin |
| 137 | |
| 138 | # --- Node CPU --- |
| 139 | |
| 140 | template: am_aks_node_cpu |
| 141 | on: azure_monitor.aks.node_cpu_percentage |
| 142 | class: Utilization |
| 143 | type: Kubernetes |
| 144 | component: AKS |
| 145 | lookup: average -5m unaligned of average |
| 146 | units: percentage |
| 147 | every: 1m |
| 148 | warn: $this > (($status >= $WARNING) ? (80) : (90)) |
| 149 | crit: $this > (($status == $CRITICAL) ? (90) : (95)) |
| 150 | delay: down 5m multiplier 1.5 max 1h |
| 151 | summary: AKS node CPU on ${label:resource_name} |
| 152 | info: Average node CPU utilization on AKS cluster ${label:resource_name} \ |
| 153 | in ${label:resource_group} (${label:region}) |
| 154 | to: sysadmin |
| 155 | |
| 156 | # --- Node Memory --- |
| 157 | |
| 158 | template: am_aks_node_memory_working_set |
| 159 | on: azure_monitor.aks.node_memory_working_set_percentage |
| 160 | class: Utilization |
| 161 | type: Kubernetes |
| 162 | component: AKS |
| 163 | lookup: average -5m unaligned of average |
| 164 | units: percentage |
| 165 | every: 1m |
| 166 | warn: $this > (($status >= $WARNING) ? (80) : (85)) |
| 167 | crit: $this > (($status == $CRITICAL) ? (85) : (95)) |
| 168 | delay: down 5m multiplier 1.5 max 1h |
| 169 | summary: AKS node memory working set on ${label:resource_name} |
| 170 | info: Average node memory working set utilization on AKS cluster ${label:resource_name} \ |
| 171 | in ${label:resource_group} (${label:region}) |
| 172 | to: sysadmin |
| 173 | |
| 174 | template: am_aks_node_memory_rss |
| 175 | on: azure_monitor.aks.node_memory_rss_percentage |
| 176 | class: Utilization |
| 177 | type: Kubernetes |
| 178 | component: AKS |
| 179 | lookup: average -5m unaligned of average |
| 180 | units: percentage |
| 181 | every: 1m |
| 182 | warn: $this > (($status >= $WARNING) ? (80) : (85)) |
| 183 | crit: $this > (($status == $CRITICAL) ? (85) : (95)) |
| 184 | delay: down 5m multiplier 1.5 max 1h |
| 185 | summary: AKS node memory RSS on ${label:resource_name} |
| 186 | info: Average node memory RSS utilization on AKS cluster ${label:resource_name} \ |
| 187 | in ${label:resource_group} (${label:region}) |
| 188 | to: sysadmin |
| 189 | |
| 190 | # --- Node Disk --- |
| 191 | |
| 192 | template: am_aks_node_disk |
| 193 | on: azure_monitor.aks.node_disk_percentage |
| 194 | class: Utilization |
| 195 | type: Kubernetes |
| 196 | component: AKS |
| 197 | lookup: average -5m unaligned of average |
| 198 | units: percentage |
| 199 | every: 1m |
| 200 | warn: $this > (($status >= $WARNING) ? (75) : (80)) |
| 201 | crit: $this > (($status == $CRITICAL) ? (85) : (90)) |
| 202 | delay: down 5m multiplier 1.5 max 1h |
| 203 | summary: AKS node disk usage on ${label:resource_name} |
| 204 | info: Average node disk utilization on AKS cluster ${label:resource_name} \ |
| 205 | in ${label:resource_group} (${label:region}). \ |
| 206 | High disk usage can cause pod evictions. |
| 207 | to: sysadmin |