Attach extra labels to jobs

[chef.git] / cookbooks / prometheus / templates / default / alert_rules.yml.erb
diff --git a/cookbooks/prometheus/templates/default/alert_rules.yml.erb b/cookbooks/prometheus/templates/default/alert_rules.yml.erb

index 2a7fd1b097d8a557c3d6a8fa0d26424aeb69f6ed..396de8de43001ed12dbce7aeca8a26f1fc55b0df 100644 (file)
--- a/cookbooks/prometheus/templates/default/alert_rules.yml.erb
+++ b/cookbooks/prometheus/templates/default/alert_rules.yml.erb
@@ -3,6 +3,13 @@
  groups:
    - name: amsterdam
      rules:
+      - alert: uplink
+        expr: ifOperStatus{site="amsterdam",ifName=~"ge-[01]/2/2"} != 1
+        for: 6m
+        labels:
+          alertgroup: "amsterdam"
+        annotations:
+          status: "{{ $value }}"
        - alert: pdu current draw
          expr: rPDU2PhaseStatusCurrent{site="amsterdam",rPDU2PhaseStatusIndex="1"} / 10 > 28
          for: 6m
@@ -11,7 +18,7 @@ groups:
          annotations:
            current: "{{ $value | humanize }}A"
        - alert: site power
-        expr: sum(avg_over_time(rPDU2PhaseStatusApparentPower{site="amsterdam",rPDU2PhaseStatusIndex="1"}[1h]) / 100) > 3
+        expr: sum(avg_over_time(rPDU2PhaseStatusApparentPower{site="amsterdam",rPDU2PhaseStatusIndex="1"}[1h]) / 100) > 3.5
          for: 6m
          labels:
            alertgroup: "amsterdam"
@@ -45,13 +52,6 @@ groups:
            alertgroup: "{{ $labels.instance }}"
          annotations:
            busy_workers: "{{ $value | humanizePercentage }}"
-      - alert: apache low request rate
-        expr: rate(apache_accesses_total[5m]) / rate(apache_accesses_total[1h] offset 1w) < 0.25 and rate(apache_accesses_total[1h] offset 1w) > 2
-        for: 15m
-        labels:
-          alertgroup: "{{ $labels.instance }}"
-        annotations:
-          request_rate: "{{ $value | humanizePercentage }}"
    - name: chef
      rules:
        - alert: chef client not running
@@ -116,6 +116,13 @@ groups:
            failure_rate: "{{ $value }} jobs/s"
    - name: dublin
      rules:
+      - alert: uplink
+        expr: ifOperStatus{site="dublin",ifName=~"ge-[01]/2/2"} != 1
+        for: 6m
+        labels:
+          alertgroup: "dublin"
+        annotations:
+          status: "{{ $value }}"
        - alert: pdu current draw
          expr: rPDU2PhaseStatusCurrent{site="dublin",rPDU2PhaseStatusIndex="1"} / 10 > 28
          for: 6m
@@ -256,10 +263,12 @@ groups:
    - name: juniper
      rules:
        - alert: juniper cpu alarm
-        expr: jnxOperatingCPU{jnxOperatingContentsIndex="7"} > 30
+        expr: jnxOperating5MinLoadAvg{jnxOperatingContentsIndex="9"} / 200 > 0.5
          for: 5m
          labels:
            alertgroup: "{{ $labels.site }}"
+        annotations:
+          load_average: "{{ $value | humanizePercentage }}"
        - alert: juniper fan alarm
          expr: jnxOperatingState{jnxOperatingContentsIndex="4",jnxOperatingState!~"running.*"} > 0
          for: 5m
@@ -278,7 +287,7 @@ groups:
          labels:
            alertgroup: "{{ $labels.instance }}"
        - alert: exim queue length
-        expr: exim_queue > exim_queue_limit
+        expr: exim_queue > ignoring(job) exim_queue_limit
          for: 60m
          labels:
            alertgroup: mail
@@ -363,14 +372,14 @@ groups:
    - name: network
      rules:
        - alert: interface transmit rate
-        expr: rate(node_network_transmit_bytes_total[1m]) / node_network_speed_bytes > 0.98
+        expr: rate(node_network_transmit_bytes_total[1m]) / node_network_speed_bytes > 0.99
          for: 5m
          labels:
            alertgroup: "{{ $labels.instance }}"
          annotations:
            bandwidth_used: "{{ $value | humanizePercentage }}"
        - alert: interface receive rate
-        expr: rate(node_network_receive_bytes_total[1m]) / node_network_speed_bytes > 0.98
+        expr: rate(node_network_receive_bytes_total[1m]) / node_network_speed_bytes > 0.99
          for: 5m
          labels:
            alertgroup: "{{ $labels.instance }}"
@@ -526,7 +535,7 @@ groups:
          annotations:
            queries: "{{ $value }}"
        - alert: postgresql idle transactions
-        expr: sum(pg_process_idle_seconds_count{state="idle in transaction"}) by (instance, server) > sum(pg_process_idle_seconds_bucket{state="idle in transaction",le="120"}) by (instance, server)
+        expr: sum(pg_process_idle_seconds_count{state="idle in transaction"}) by (instance, server) > sum(pg_process_idle_seconds_bucket{state="idle in transaction",le="300"}) by (instance, server)
          for: 5m
          labels:
            alertgroup: "{{ $labels.instance }}"
@@ -675,7 +684,7 @@ groups:
            age: "{{ $value | humanizeDuration }}"
        - alert: taginfo database size
          expr: abs(delta(taginfo_database_size_bytes[30m])) / taginfo_database_size_bytes > 0.1
-        for: 0m
+        for: 30m
          labels:
            alertgroup: taginfo
          annotations:
@@ -727,8 +736,8 @@ groups:
          annotations:
            error_rate: "{{ $value | humanizePercentage }}"
        - alert: job processing rate
-        expr: rate(pg_stat_user_tables_n_tup_del{datname="openstreetmap",relname="delayed_jobs"}[5m]) / rate(pg_stat_user_tables_n_tup_ins{datname="openstreetmap",relname="delayed_jobs"}[5m]) < 0.9 and ignoring(job, name, datname, relname, schemaname, server) chef_role{name="db-master"} == 1
-        for: 15m
+        expr: rate(pg_stat_user_tables_n_tup_del{datname="openstreetmap",relname="delayed_jobs"}[1h]) / rate(pg_stat_user_tables_n_tup_ins{datname="openstreetmap",relname="delayed_jobs"}[1h]) < 0.9 and ignoring(job, name, datname, relname, schemaname, server) chef_role{name="db-master"} == 1
+        for: 1h
          labels:
            alertgroup: web
          annotations: