TRIAGE
Contexte, impact, inventaire et événements avant toute mutation.
Du premier kubectl au failover régional : diagnostique des pannes réalistes, choisis l’action au blast radius minimal et prouve la restauration comme en production.
Les scénarios reproduisent contextes, événements, contrôleurs, métriques et décisions d’une production Kubernetes. Ils sont déterministes et isolés : aucune commande ne touche le serveur OpsArena ni une infrastructure cliente.
Contexte, impact, inventaire et événements avant toute mutation.
Cause testable, signaux contradictoires et blast radius explicite.
Action réversible, ciblée et compatible avec les protections du cluster.
État Kubernetes, SLI utilisateur et decision check enregistré.
La maîtrise exige l’exécution technique et la bonne décision de fermeture. Un lab simplement terminé n’est pas encore maîtrisé.
0/6 compétences prouvées
0/4 compétences prouvées
0/4 compétences prouvées
0/6 compétences prouvées
Chaque phase contient cinq situations de production et augmente l’ambiguïté, la portée et le niveau de responsabilité.
Cibler, observer et restaurer les objets Kubernetes essentiels.
Évite une intervention sur le mauvais contexte et retrouve le workload en incident.
Diagnostique un pod qui ne quitte jamais Pending sans supprimer de ressources au hasard.
Retrouve la configuration fautive d’un conteneur qui redémarre trop vite.
Analyse un déploiement progressif et reviens à une révision saine sans interruption supplémentaire.
Restaure le trafic en corrigeant un contrat labels/selectors cassé.
Concevoir santé, ressources, stockage, placement et autoscaling.
Sépare santé du processus et capacité réelle à recevoir du trafic.
Dimensionne requests et limits à partir des métriques et protège le nœud.
Corrige une contrainte de scheduling qui annule la haute disponibilité zonale.
Diagnostique un volume non provisionné et restaure le StatefulSet sans perte de données.
Restaure l’autoscaling en réparant métriques et requests plutôt qu’en surprovisionnant.
Appliquer least privilege, zero-trust et déploiements réversibles.
Répare un droit manquant avec le privilège minimal et sans cluster-admin.
Ouvre uniquement le flux nécessaire entre deux workloads sans annuler le deny-all.
Rends un workload compatible avec Restricted sans désactiver la politique de sécurité.
Analyse une release Failed, identifie la valeur fautive et restaure une révision connue.
Restaure la source de vérité sans laisser un hotfix live être écrasé silencieusement.
Commander des incidents cluster, régionaux et de cycle de vie.
Distingue panne DNS, Service et application puis restaure CoreDNS sans masquer la cause.
Évacue un nœud dégradé sans violer les budgets de disponibilité.
Prépare une montée de version en traitant API dépréciées, PDB et capacité.
Bascule un service entre régions en protégeant données, DNS et retour arrière.
Conduis un incident combinant saturation, release fautive et dépendance dégradée.
Le vingtième lab combine release fautive, retry storm, HPA saturé, dépendance lente, SLO et communication P1. Tu ne gagnes pas en lançant le plus de commandes : tu gagnes en prenant la meilleure décision.
DÉBLOQUER LE PARCOURS →