Fix exim mail queue alerts

[chef.git] / cookbooks / prometheus / templates / default / alert_rules.yml.erb
diff --git a/cookbooks/prometheus/templates/default/alert_rules.yml.erb b/cookbooks/prometheus/templates/default/alert_rules.yml.erb

index b53007521e9c3df529ff600d122c5db4d04c217f..c7c3a1bac2e4f574fa0541dc0df5812382071f66 100644 (file)
--- a/cookbooks/prometheus/templates/default/alert_rules.yml.erb
+++ b/cookbooks/prometheus/templates/default/alert_rules.yml.erb
@@ -11,7 +11,7 @@ groups:
          annotations:
            current: "{{ $value | humanize }}A"
        - alert: site power
-        expr: sum(avg_over_time(rPDU2PhaseStatusApparentPower{site="amsterdam",rPDU2PhaseStatusIndex="1"}[1h]) / 100) > 3
+        expr: sum(avg_over_time(rPDU2PhaseStatusApparentPower{site="amsterdam",rPDU2PhaseStatusIndex="1"}[1h]) / 100) > 3.5
          for: 6m
          labels:
            alertgroup: "amsterdam"
@@ -45,13 +45,6 @@ groups:
            alertgroup: "{{ $labels.instance }}"
          annotations:
            busy_workers: "{{ $value | humanizePercentage }}"
-      - alert: apache low request rate
-        expr: rate(apache_accesses_total[5m]) / rate(apache_accesses_total[1h] offset 1w) < 0.25 and rate(apache_accesses_total[1h] offset 1w) > 2
-        for: 15m
-        labels:
-          alertgroup: "{{ $labels.instance }}"
-        annotations:
-          request_rate: "{{ $value | humanizePercentage }}"
    - name: chef
      rules:
        - alert: chef client not running
@@ -278,7 +271,7 @@ groups:
          labels:
            alertgroup: "{{ $labels.instance }}"
        - alert: exim queue length
-        expr: exim_queue > exim_queue_limit
+        expr: exim_queue > ignoring(job) exim_queue_limit
          for: 60m
          labels:
            alertgroup: mail
@@ -363,14 +356,14 @@ groups:
    - name: network
      rules:
        - alert: interface transmit rate
-        expr: rate(node_network_transmit_bytes_total[1m]) / node_network_speed_bytes > 0.98
+        expr: rate(node_network_transmit_bytes_total[1m]) / node_network_speed_bytes > 0.99
          for: 5m
          labels:
            alertgroup: "{{ $labels.instance }}"
          annotations:
            bandwidth_used: "{{ $value | humanizePercentage }}"
        - alert: interface receive rate
-        expr: rate(node_network_receive_bytes_total[1m]) / node_network_speed_bytes > 0.98
+        expr: rate(node_network_receive_bytes_total[1m]) / node_network_speed_bytes > 0.99
          for: 5m
          labels:
            alertgroup: "{{ $labels.instance }}"
@@ -526,7 +519,7 @@ groups:
          annotations:
            queries: "{{ $value }}"
        - alert: postgresql idle transactions
-        expr: sum(pg_process_idle_seconds_count{state="idle in transaction"}) by (instance, server) > sum(pg_process_idle_seconds_bucket{state="idle in transaction",le="120"}) by (instance, server)
+        expr: sum(pg_process_idle_seconds_count{state="idle in transaction"}) by (instance, server) > sum(pg_process_idle_seconds_bucket{state="idle in transaction",le="300"}) by (instance, server)
          for: 5m
          labels:
            alertgroup: "{{ $labels.instance }}"
@@ -727,8 +720,8 @@ groups:
          annotations:
            error_rate: "{{ $value | humanizePercentage }}"
        - alert: job processing rate
-        expr: rate(pg_stat_user_tables_n_tup_del{datname="openstreetmap",relname="delayed_jobs"}[5m]) / rate(pg_stat_user_tables_n_tup_ins{datname="openstreetmap",relname="delayed_jobs"}[5m]) < 0.9 and ignoring(job, name, datname, relname, schemaname, server) chef_role{name="db-master"} == 1
-        for: 15m
+        expr: rate(pg_stat_user_tables_n_tup_del{datname="openstreetmap",relname="delayed_jobs"}[1h]) / rate(pg_stat_user_tables_n_tup_ins{datname="openstreetmap",relname="delayed_jobs"}[1h]) < 0.9 and ignoring(job, name, datname, relname, schemaname, server) chef_role{name="db-master"} == 1
+        for: 1h
          labels:
            alertgroup: web
          annotations: