Skip to main content
Production Incident Simulation

Support Arena

Investigate real-world production incidents inspired by enterprise Databricks, Snowflake, and PySpark workflows. Diagnose failures, analyze logs, and resolve engineering incidents under pressure.

High

Bad / Invalid Records

Production ingestion pipeline detected invalid negative values and null records violating business validation rules.

Difficulty:Beginner
Start Investigation →
Critical

Schema Mismatch Incident

Source file schema changed unexpectedly causing downstream Databricks ingestion failure.

Difficulty:Beginner
Start Investigation →
Critical

Missing Source File

Daily partition file was not delivered on time causing SLA delays in reporting pipelines.

Difficulty:Intermediate
Start Investigation →
Critical

Duplicate Data Load

Retry mechanism triggered duplicate ingestion causing duplicate reporting metrics in Snowflake.

Difficulty:Intermediate
Start Investigation →
Critical

Failed Upsert / Merge

Merge operation failed due to conflicting keys and transactional inconsistencies.

Difficulty:Intermediate
Start Investigation →
High

Data Skew Investigation

Spark job suffering severe skew causing executor memory failures and long runtimes.

Difficulty:Advanced
Start Investigation →
High

Dependency Conflict

Runtime upgrade introduced incompatible package dependencies breaking ETL jobs.

Difficulty:Advanced
Start Investigation →
Critical◆ PREMIUM

Job Timeout Incident

Large production ETL pipeline exceeded SLA due to poor optimization and cluster bottlenecks.

Difficulty:Advanced
Start Investigation →
Medium

Incorrect Configuration

Wrong process date parameter caused incorrect historical partition loading.

Difficulty:Intermediate
Start Investigation →