Résilience & reprise d'activité
La question n'est pas de savoir si vous avez des sauvegardes, mais si elles se restaurent.
- Sauvegarde Velero multi-namespace, stockage S3 (MinIO, Swift), volumes Longhorn
- Restauration validée de bout en bout jusqu'à 4,44 To en production
- Diagnostic et correction de défaillances de sauvegarde silencieuses
Sécurité, secrets & identité
Les accès et les secrets sont l'endroit où les plateformes vieillissent le plus mal.
- Vault : politiques d'accès, unseal automatique, intégration applicative
- Keycloak / OIDC : realms, clients, incidents d'authentification en production
- RBAC, network policies, gestion des CVE critiques, WAF
Automatisation & Infrastructure as Code
Une plateforme qui ne se reconstruit pas à l'identique n'est pas maîtrisée.
- Terraform / Terragrunt sur OpenStack, AWS, Azure et GCP
- Ansible à l'échelle : rôles dynamiques, inventaire dynamique, tests Molecule
- Référent Ansible d'une équipe plateforme grand compte
Observabilité & incidents critiques
Voir venir la panne coûte moins cher que la subir un dimanche soir.
- Prometheus, Grafana, Alertmanager, Loki : dashboards et alerting sur mesure
- Incidents résolus en production : saturation etcd, pannes d'authentification
- Astreintes sur périmètre critique et coordination éditeur