@cryptotaxi247 / infra-1 / commits / ae0976cb

prometheus: update grafana annotation urls

Use the grafana.nixos.org domain and reference the node-exporter-full dashboard instead of per-instance-metrics.

Martin Weinelt committed Jan 6, 2025 at 01:49 UTC ae0976cbbe0eaf801932727101a9f262c3098cfe
3 files changed +8 -6
build/pluto/prometheus/exporters/hydra.nix
+1 -1
@@ -74,7 +74,7 @@
74 for = "30m";
75 labels.severity = "warning";
76 annotations.summary = "{{ $labels.machine }} has {{ $value }} over-age jobs.";
77 - annotations.grafana = "https://monitoring.nixos.org/grafana/d/j0hJAY1Wk/in-progress-build-duration-heatmap";
77 + annotations.grafana = "https://grafana.nixos.org/d/j0hJAY1Wk/in-progress-build-duration-heatmap";
78 }
79 {
80 alert = "HydraQueueRunnerUp";
build/pluto/prometheus/exporters/node.nix
+6 -4
@@ -74,7 +74,7 @@
74 for = "30m";
75 labels.severity = "warning";
76 annotations.summary = "{{ $labels.device }} mounted to {{ $labels.mountpoint }} ({{ $labels.fstype }}) on {{ $labels.instance }} has {{ $value }} inodes free.";
77 - annotations.grafana = "https://monitoring.nixos.org/grafana/d/5LANB9pZk/per-instance-metrics?orgId=1&refresh=30s&var-instance={{ $labels.instance }}";
77 + annotations.grafana = "https://grafana.nixos.org/d/rYdddlPWk/node-exporter-full?orgId=1&var-job=node&var-node={{ $labels.instance }}";
78 }
79 {
80 alert = "PartitionLowDiskSpace";
@@ -86,11 +86,13 @@
86 for = "30m";
87 labels.severity = "warning";
88 annotations.summary = "{{ $labels.device }} mounted to {{ $labels.mountpoint }} ({{ $labels.fstype }}) on {{ $labels.instance }} has {{ $value }} GB free.";
89 - annotations.grafana = "https://monitoring.nixos.org/grafana/d/5LANB9pZk/per-instance-metrics?orgId=1&refresh=30s&var-instance={{ $labels.instance }}";
89 + annotations.grafana = "https://grafana.nixos.org/d/rYdddlPWk/node-exporter-full?orgId=1&var-job=node&var-node=caliban.nixos.org:9100{{ $labels.instance }}";
90 }
91 {
92 alert = "SystemdUnitFailed";
93 - expr = ''node_systemd_unit_state{state="failed"} == 1'';
93 + expr = ''
94 + node_systemd_unit_state{state="failed"} == 1
95 + '';
96 for = "15m";
97 labels.severity = "warning";
98 annotations.summary = "systemd unit {{ $labels.name }} on {{ $labels.instance }} has been down for more than 15 minutes.";
@@ -106,7 +108,7 @@
108 for = "30m";
109 labels.severity = "warning";
110 annotations.summary = "{{ $labels.name }} on {{ $labels.instance }}";
109 - annotations.grafana = "https://monitoring.nixos.org/grafana/d/fBW4tL1Wz/scheduled-task-state-channels-website?orgId=1&refresh=10s";
111 + annotations.grafana = "https://grafana.nixos.org/d/fBW4tL1Wz/scheduled-task-state-channels-website?orgId=1&refresh=10s";
112 }
113 ];
114 }
build/pluto/prometheus/exporters/rfc39.nix
+1 -1
@@ -29,7 +29,7 @@
29 expr = ''node_systemd_unit_state{name=~"^rfc39-sync.service$", state="failed"} == 1'';
30 for = "30m";
31 labels.severity = "warning";
32 - annotations.grafana = "https://monitoring.nixos.org/grafana/d/fBW4tL1Wz/scheduled-task-state-channels-website?orgId=1&refresh=10s";
32 + annotations.grafana = "https://grafana.nixos.org/d/fBW4tL1Wz/scheduled-task-state-channels-website?orgId=1&refresh=10s";
33 }
34 ];
35 }