Cluster Rebuild
Wiederherstellung eines Kubernetes-Clusters nach vollständigem Verlust aller Nodes oder nach einer Neuinstallation.
Dieses Runbook beschreibt die Wiederherstellung eines Clusters auf Basis von Talos Linux, FluxCD und GitOps.
Voraussetzungen
-
Zugriff auf das Git Repository
-
Zugriff auf die Domainverwaltung
-
Zugriff auf Hetzner Object Storage
-
Zugriff auf Talos-Konfigurationen
-
Zugriff auf SOPS-Schlüssel
-
Zugriff auf Netcup oder Home-Hardware
Wiederherstellungsreihenfolge
Die Reihenfolge muss eingehalten werden.
Talos
↓
Kubernetes
↓
Cilium
↓
Storage
↓
FluxCD
↓
Infrastructure
↓
Applications
↓
Backups
Cluster löschen
Falls ein beschädigter Cluster noch existiert:
talosctl reset --graceful=false --reboot
auf allen Nodes ausführen.
Talos installieren
Kubernetes prüfen
Alle Nodes müssen verfügbar sein.
kubectl get nodes
Kontrollieren:
-
Nodes Ready
-
etcd Healthy
-
API erreichbar
Cilium installieren
Cilium wird vor allen weiteren Komponenten installiert.
kubectl get pods -A
Prüfen:
-
cilium
-
cilium-operator
-
hubble
müssen fehlerfrei laufen.
Infrastruktur prüfen
Folgende Komponenten müssen erfolgreich synchronisiert werden:
-
Cert Manager
-
ExternalDNS
-
External Secrets
-
Piraeus
-
Victoria Metrics
-
Victoria Logs
-
Velero
Prüfen:
kubectl get pods -A
Keine Komponenten dürfen sich im Status:
-
CrashLoopBackOff
-
Pending
-
ImagePullBackOff
befinden.
Anwendungen prüfen
Kontrollieren:
kubectl get pods -A
Zusätzlich prüfen:
-
Immich
-
Paperless
-
Jellyfin
-
Home Assistant
-
Vaultwarden
-
Matrix
-
Mail