Pendant longtemps, on découvrait qu'un service était en panne… parce qu'un client nous le signalait. Ce n'est plus vraiment tenable dès qu'on héberge des choses pour de vrai.
On a donc mis en place une stack de supervision : suivi des performances en temps réel, état de santé des disques, et une vue centralisée sur les logs de tous les conteneurs.
Résultat : on voit un problème avant qu'il devienne visible pour vous. C'est aussi bête que ça, mais ça change tout.
