Ops Briefing Surface

Production Reliability Dashboard

Generated 2026-08-03 02:11 for 2026-07-26 10:00 to 2026-08-02 10:00 from Pingdom checks, Slack #_alerts_prod, and AWS SNS alerts.

All sources Pingdom customer checks Slack alert families AWS alarm emails
Email-confirmed customer incidents0Pingdom down/slow events confirmed by inbox alertsObserved in Pingdom: 7
Impacted services10Mapped from Slack and Pingdom evidence
AWS alarms in ALARM0Still alarming at window end
Latest observed signal2026-08-02 09:44Most recent cross-source activity
Executive summary

What needs attention

Bottom line: Pingdom observed recent customer-facing glitches (email unconfirmed) and application-level critical paths are present.

Pingdom customer impact

External signal
No criticalActive: 2Total seen: 2

2 active item(s) in this window.

Slack impacted services

Application signal
3 criticalActive: 9Total seen: 9

3 critical, 6 non-critical active item(s).

AWS alarms

Infrastructure signal
No criticalActive: 0Total seen: 0

No AWS alarm emails were captured in this window.

No active issue listed in this category.

What to do next

  1. NextUse Pingdom check Adservio Ro as churn/degradation evidence, and escalate to customer-facing incident priority only after inbox confirmation or strong cross-source correlation

    Use Pingdom check Adservio Ro as churn/degradation evidence, and escalate to customer-facing incident priority only after inbox confirmation or strong cross-source correlation.

    Executive recommendation
  2. ThenTreat critical services grafana, admission-api, web-80 as the primary application investigation set

    Treat critical services grafana, admission-api, web-80 as the primary application investigation set. Use CriticalPagerDutyTest as the leading category, reproduce the failing paths on grafana, admission-api, web-80, compare against the latest deploy or config change, and do not close it until both error rate and latency flatten.

    Executive recommendation
Global Evidence Explorer

Global Evidence Explorer

Report-wide charts and tables stay here, separate from the active investigation scope.

Application + Infrastructure Alerts by Day

Pingdom latency + downtime by source

Customer View

Pingdom Checks

Pingdom CheckStatusEventsDowntimeLast SeenLikely ServicesCorrelated Evidence
Adservio RoRecovered recently66m2026-07-31 22:40unclassified
Backend StatusSeen this week10m2026-07-29 14:19unclassified

Pingdom rows show externally visible signal first. The correlated evidence column helps tie the failing check back to services, Slack alert families, or AWS alarms when those links exist.

Application View

Slack Impacted Service / Resource View

This view attributes alerts to the workload or resource named in the alert text. Grafana, Loki, and Tempo are treated as observability components and are excluded when a more specific impacted target is also present.

Impacted Service / ResourceHighest SeverityCountLast SeenStatusTop Alert TypesDiscussion SignalLatest Thread Note
grafanaCritical272026-08-01 20:16Seen todayKubeAPIErrorBudgetBurn (2)PlatformLatencyP95Critical1s (1)RESOLVED [prod] - PlatformLatencyP95Warning400ms (2)Warning [prod] - PlatformLatencyP95Warning400ms (2)KubeletServerCertificateExpiration (4)NoneNo thread note
web-80Critical82026-08-01 20:21Seen todayTraefikServiceHighLatencyCritical (1)RESOLVED [prod] - TraefikServiceHighLatency (1)Warning [prod] - TraefikServiceHighLatency (1)RESOLVED [prod] - TraefikServiceHighLatencyCritical (2)CRITICAL [prod] - TraefikServiceHighLatencyCritical (2)NoneNo thread note
admission-api
Grouped 2 variantsVariant mentions 6Active variants 2
Critical62026-07-27 12:10Seen this weekTraefikServiceHighLatencyCritical (1)RESOLVED [prod] - KubePodContainerRestartingFrequently (1)Warning [prod] - KubePodContainerRestartingFrequently (1)RESOLVED - KubePodContainerRestartingFrequently (1)KubePodContainerRestartingFrequently (1)NoneNo thread note
minicrm-sync
Grouped 2 variantsVariant mentions 10Active variants 2
Warning102026-08-02 09:44Seen todayWarning [tuiasi] - KubeJobFailed (8)RESOLVED [tuiasi] - KubePodContainerRestartingFrequently (1)Warning [tuiasi] - KubePodContainerRestartingFrequently (1)NoneNo thread note
billing-apiWarning62026-07-30 17:16Recent (72h)RESOLVED [prod] - TraefikServiceHighLatency (2)Warning [prod] - TraefikServiceHighLatency (2)RESOLVED [prod] - TraefikServiceHighLatencyCritical (1)CRITICAL [prod] - TraefikServiceHighLatencyCritical (1)NoneNo thread note
core-scheduled-events-workerWarning22026-08-01 05:37Recent (72h)RESOLVED [tuiasi] - KubePodContainerRestartingFrequently (1)Warning [tuiasi] - KubePodContainerRestartingFrequently (1)NoneNo thread note
core-grafanaWarning22026-07-30 17:25Recent (72h)RESOLVED [tuiasi] - KubePodContainerRestartingFrequently (1)Warning [tuiasi] - KubePodContainerRestartingFrequently (1)NoneNo thread note
metrics-serverWarning72026-07-27 10:58Seen this weekKubeAggregatedAPIDown (7)NoneNo thread note
core-public-ingress
Grouped 2 variantsVariant mentions 4Active variants 2
Warning22026-07-27 02:57Seen this weekRESOLVED - KubePodContainerRestartingFrequently (1)KubePodContainerRestartingFrequently (1)NoneNo thread note
Evidence

Slack Alert Families

AlertSeverityCountLast SeenStatusThreadsTop Impacted ServicesDiscussion SignalLatest Thread Note
TraefikServiceHighLatencyCriticalCritical22026-07-27 09:23Seen this week0web-80 (1)admission-api (1)None
CriticalPagerDutyTestCritical12026-07-27 18:23Seen this week0grafana (1)None
PlatformLatencyP95Critical1sCritical12026-07-27 03:33Seen this week0grafana (1)None
KubeAPIErrorBudgetBurnCritical12026-07-26 14:35Seen this week0grafana (2)None
Warning [tuiasi] - KubeJobFailedWarning82026-08-02 09:44Seen today0minicrm-sync (8)None
RESOLVED [prod] - TraefikServiceHighLatencyWarning32026-08-01 20:21Seen today0billing-api (2)web-80 (1)None
Warning [prod] - TraefikServiceHighLatencyWarning32026-08-01 20:01Seen today0billing-api (2)web-80 (1)None
RESOLVED [prod] - PlatformLatencyP95Warning400msWarning22026-08-01 20:16Seen today0grafana (2)None
Warning [prod] - PlatformLatencyP95Warning400msWarning22026-08-01 20:01Seen today0grafana (2)None
RESOLVED [tuiasi] - KubePodContainerRestartingFrequentlyWarning32026-08-01 05:37Recent (72h)0core-grafana (1)minicrm-sync (1)core-scheduled-events-worker (1)None
Warning [tuiasi] - KubePodContainerRestartingFrequentlyWarning32026-08-01 05:07Recent (72h)0core-grafana (1)minicrm-sync (1)core-scheduled-events-worker (1)None
RESOLVED [prod] - TraefikServiceHighLatencyCriticalWarning32026-07-31 04:21Recent (72h)0web-80 (2)billing-api (1)None
CRITICAL [prod] - TraefikServiceHighLatencyCriticalWarning32026-07-31 04:16Recent (72h)0web-80 (2)billing-api (1)None
RESOLVED [prod] - Platform5xxLowVolumeWarning20Warning12026-07-30 11:11Recent (72h)0grafana (1)None
Warning [prod] - Platform5xxLowVolumeWarning20Warning12026-07-30 11:06Recent (72h)0grafana (1)None
KubeAggregatedAPIDownWarning72026-07-27 10:58Seen this week0metrics-server (7)None
KubeletServerCertificateExpirationWarning42026-07-27 06:27Seen this week0grafana (4)None
WatchdogWarning32026-07-27 10:58Seen this week0grafana (3)None
RESOLVED - KubeAPIErrorBudgetBurnWarning32026-07-26 20:41Seen this week0grafana (3)None
RESOLVED - KubePodContainerRestartingFrequentlyWarning22026-07-27 10:10Seen this week0core-public-ingress (1)admission-api (1)None
KubePodContainerRestartingFrequentlyWarning22026-07-27 09:40Seen this week0core-public-ingress (1)admission-api (1)None
RESOLVED - TraefikServiceHighLatencyCriticalWarning22026-07-27 09:33Seen this week0web-80 (1)admission-api (1)None
RESOLVED [prod] - PlatformLatencyP95Critical1sWarning12026-07-29 03:52Seen this week0grafana (1)None
CRITICAL [prod] - PlatformLatencyP95Critical1sWarning12026-07-29 03:47Seen this week0grafana (1)None
RESOLVED - CriticalPagerDutyTestWarning12026-07-27 18:28Seen this week0grafana (1)None
RESOLVED [prod] - KubePodContainerRestartingFrequentlyWarning12026-07-27 12:10Seen this week0admission-api (1)None
Warning [prod] - KubePodContainerRestartingFrequentlyWarning12026-07-27 11:55Seen this week0admission-api (1)None
RESOLVED [prod] - ClusterLabelTestWarning12026-07-27 11:11Seen this week0grafana (1)None
Warning [prod] - ClusterLabelTestWarning12026-07-27 11:06Seen this week0grafana (1)None
RESOLVED - KubeletServerCertificateExpirationWarning12026-07-27 09:17Seen this week0grafana (1)None
RESOLVED - PlatformLatencyP95Critical1sWarning12026-07-27 03:38Seen this week0grafana (1)None
KubeAPIErrorBudgetBurnWarning12026-07-26 16:51Seen this week0grafana (2)None

Status is heuristic. Slack rarely posts explicit resolutions, so “Seen today” or “Recent” means the alert family still appeared in production recently, not that it is definitely unresolved.

AWS Email Alarm Families

AWS AlarmEmailsALARMOKState FlipsFirst SeenLast SeenLatest StateStatus

“Flapping, latest OK” means the most recent email was an OK, but the alarm toggled repeatedly and is still a reliability concern.

Global Discussion-Derived Signal

Thread DateAlertSeverityServicesSignalKey Notes