// KUBERNETES PRODUCTION ARENA

20 INCIDENTS.
UN CLUSTER À SAUVER.

Du premier kubectl au failover régional : diagnostique des pannes réalistes, choisis l’action au blast radius minimal et prouve la restauration comme en production.

TESTER LE PREMIER LAB →2 LABS GRATUITS · AUCUN CLUSTER À INSTALLER
PRODUCTION REPRODUITE, RISQUE ZÉRO.

Les scénarios reproduisent contextes, événements, contrôleurs, métriques et décisions d’une production Kubernetes. Ils sont déterministes et isolés : aucune commande ne touche le serveur OpsArena ni une infrastructure cliente.

01

TRIAGE

Contexte, impact, inventaire et événements avant toute mutation.

02

HYPOTHÈSE

Cause testable, signaux contradictoires et blast radius explicite.

03

MITIGATION

Action réversible, ciblée et compatible avec les protections du cluster.

04

PREUVE

État Kubernetes, SLI utilisateur et decision check enregistré.

// READINESS MATRIX

TA MAÎTRISE,
DOMAINE PAR DOMAINE.

La maîtrise exige l’exécution technique et la bonne décision de fermeture. Un lab simplement terminé n’est pas encore maîtrisé.

Workloads0%

0/6 compétences prouvées

Pods & événementsDeploymentsSanté applicativeRessourcesScheduling
Réseau & stockage0%

0/4 compétences prouvées

Réseau serviceNetworkPolicyDNS & réseauStockage
Sécurité & delivery0%

0/4 compétences prouvées

RBACPod SecurityHelmGitOps
Production0%

0/6 compétences prouvées

NœudsCycle de vie clusterMulti-clusterIncident commandAccès & contexteAutoscaling
// 4 PHASES · 20 INCIDENTS

DE KUBECTL
À INCIDENT COMMANDER.

Chaque phase contient cinq situations de production et augmente l’ambiguïté, la portée et le niveau de responsabilité.

01
DÉBUTANT

Fondations cluster

Cibler, observer et restaurer les objets Kubernetes essentiels.

0/5 MAÎTRISÉS
01
Accès & contexte · prod-eu

Le mauvais cluster

Évite une intervention sur le mauvais contexte et retrouve le workload en incident.

02
Pods & événements · prod-eu

Pod Pending

Diagnostique un pod qui ne quitte jamais Pending sans supprimer de ressources au hasard.

03
Pods & événements · prod-eu

CrashLoopBackOff

Retrouve la configuration fautive d’un conteneur qui redémarre trop vite.

04
Deployments · prod-eu

Rollout bloqué

Analyse un déploiement progressif et reviens à une révision saine sans interruption supplémentaire.

05
Réseau service · prod-eu

Service sans endpoints

Restaure le trafic en corrigeant un contrat labels/selectors cassé.

02
INTERMÉDIAIRE

Workloads fiables

Concevoir santé, ressources, stockage, placement et autoscaling.

0/5 MAÎTRISÉS
06
Santé applicative · prod-eu

Readiness mensongère

Sépare santé du processus et capacité réelle à recevoir du trafic.

07
Ressources · prod-eu

OOMKilled en cascade

Dimensionne requests et limits à partir des métriques et protège le nœud.

08
Scheduling · prod-eu

Replica sans zone

Corrige une contrainte de scheduling qui annule la haute disponibilité zonale.

09
Stockage · prod-eu

PVC Pending

Diagnostique un volume non provisionné et restaure le StatefulSet sans perte de données.

10
Autoscaling · prod-eu

HPA aveugle

Restaure l’autoscaling en réparant métriques et requests plutôt qu’en surprovisionnant.

03
AVANCÉ

Sécurité & livraison

Appliquer least privilege, zero-trust et déploiements réversibles.

0/5 MAÎTRISÉS
11
RBAC · prod-eu

Forbidden en production

Répare un droit manquant avec le privilège minimal et sans cluster-admin.

12
NetworkPolicy · prod-eu

Egress coupé

Ouvre uniquement le flux nécessaire entre deux workloads sans annuler le deny-all.

13
Pod Security · prod-eu

Admission refusée

Rends un workload compatible avec Restricted sans désactiver la politique de sécurité.

14
Helm · prod-eu

Release Helm atomique

Analyse une release Failed, identifie la valeur fautive et restaure une révision connue.

15
GitOps · prod-eu

Dérive GitOps

Restaure la source de vérité sans laisser un hotfix live être écrasé silencieusement.

04
PRO

Production avancée

Commander des incidents cluster, régionaux et de cycle de vie.

0/5 MAÎTRISÉS
16
DNS & réseau · prod-eu

DNS du cluster

Distingue panne DNS, Service et application puis restaure CoreDNS sans masquer la cause.

17
Nœuds · prod-eu

Node sous pression

Évacue un nœud dégradé sans violer les budgets de disponibilité.

18
Cycle de vie cluster · prod-eu

Upgrade sans disruption

Prépare une montée de version en traitant API dépréciées, PDB et capacité.

19
Multi-cluster · prod-eu + prod-dr

Failover régional

Bascule un service entre régions en protégeant données, DNS et retour arrière.

20
Incident command · prod-eu

Black Friday — Incident P1

Conduis un incident combinant saturation, release fautive et dépendance dégradée.

// CAPSTONE

BLACK FRIDAY.
12% D’ERREURS.

Le vingtième lab combine release fautive, retry storm, HPA saturé, dépendance lente, SLO et communication P1. Tu ne gagnes pas en lançant le plus de commandes : tu gagnes en prenant la meilleure décision.

DÉBLOQUER LE PARCOURS →