Incidents
Un nœud disparaît
kubectl get nodes -o wide
kubectl describe node <nom>
Contrôler ensuite sur le VPS : systemctl status k3s, wg show, ufw status et l'espace disque. Avec trois membres etcd, un seul nœud peut être indisponible sans perte de quorum.
Un pod n'est pas prêt
- Lire
describeet les événements. - Lire les logs de tous les conteneurs.
- Vérifier les probes, ressources, ConfigMaps, Secrets et PVC.
- Vérifier que Flux n'est pas en train de réconcilier une version différente.
Erreur DNS ou TLS
Resolve-DnsName <hôte> -Server 1.1.1.1
kubectl get certificate,certificaterequest,challenge -A
kubectl -n cert-manager logs deployment/cert-manager --tail=200
Les hôtes *.lab.djayzone.com doivent rester en DNS only tant qu'aucun certificat Cloudflare couvrant deux niveaux n'est acheté.
Flux en erreur
kubectl get kustomizations,gitrepositories -A
kubectl -n flux-system describe kustomization apps
kubectl -n flux-system logs deployment/kustomize-controller --tail=200
Corriger le manifeste dans Git. Éviter une correction directe avec kubectl edit, car Flux la remplacera.
Perte du quorum etcd
Ne pas réinitialiser plusieurs serveurs au hasard. Conserver les disques, arrêter les actions destructrices et restaurer depuis un snapshot K3s documenté dans la section Sauvegarde.