SP2 — Supervision du parc avec Zabbix et Grafana
- Contexte / organisation
- Projet mené en cours, en binôme, sur l'infrastructure de la salle réseau de l'établissement.
- Période
- Trimestre / semestre AAAA
- Épreuve(s) visée(s)
- E6 (supervision, analyse d'indicateurs, détection d'anomalies), E4 (dossier de choix, recette)
- Environnement technique
- Debian 12, Zabbix Server 6 LTS, agent Zabbix, SNMP v2c/v3, Grafana, VMware / Proxmox
- Outils
- Zabbix (serveur, frontend, agent), Grafana, SNMP, SSH, navigateur
1. Contexte et besoin
Les pannes (service arrêté, disque plein, lien réseau coupé) n'étaient constatées qu'au moment où un utilisateur se plaignait. Il n'existait aucune visibilité sur la disponibilité ni sur la charge des serveurs et des équipements réseau.
Objectifs :
- Mettre en place un outil de supervision centralisé et open source.
- Surveiller : état des hôtes (ping), CPU / RAM / disque, services critiques, ports réseau, trafic.
- Définir des seuils et des alertes par courriel.
- Produire des tableaux de bord lisibles pour un non-spécialiste.
2. Étude et choix de la solution
| Critère | Nagios Core | Zabbix | Centreon |
|---|---|---|---|
| Configuration | Fichiers texte | Interface web + templates | Interface web |
| Découverte automatique | Limitée | Oui (règles LLD) | Oui |
| Métriques & historisation | Add-ons | Intégrée (BDD) | Intégrée |
| Courbe d'apprentissage | Élevée | Moyenne | Moyenne |
| Coût | Gratuit | Gratuit | Gratuit (édition libre) |
Décision : Zabbix, pour la découverte automatique, les modèles prêts à l'emploi (Linux, Windows, SNMP) et l'historisation native, complété par Grafana pour des tableaux de bord soignés.
3. Solution mise en œuvre
- Installation de Zabbix Server + frontend + base de données sur Debian, accès HTTPS.
- Déploiement de l'agent Zabbix sur les serveurs Linux et Windows (modèles officiels).
- Activation de SNMP sur le switch et le routeur, ajout via le modèle « Network Generic SNMP ».
- Règles de découverte réseau sur le sous-réseau d'administration pour l'ajout automatique des hôtes.
- Définition des déclencheurs : hôte injoignable 3 min, disque > 85 %, CPU > 90 % pendant 5 min, service arrêté.
- Actions et notifications par courriel (média SMTP) avec escalade après 15 min.
- Connexion de Grafana à la source de données Zabbix, création d'un tableau de bord « Vue d'ensemble ».
Extrait — déclencheur Zabbix (syntaxe d'expression)
Nom : Disque / presque plein sur {HOST.NAME}
Sévérité : Haute
Expression :
last(/{HOST.NAME}/vfs.fs.size[/,pused]) > 85
Récupération :
last(/{HOST.NAME}/vfs.fs.size[/,pused]) < 80
Captures à insérer : assets/img/sp2-zabbix-map.png, assets/img/sp2-grafana.png.
4. Tests et recette
| Scénario | Attendu | Résultat |
|---|---|---|
| Arrêt volontaire d'une VM supervisée | Alerte « hôte injoignable » + courriel < 5 min | Conforme (3 min 40) |
| Remplissage d'un disque de test à 90 % | Déclencheur « disque presque plein » Haute | Conforme |
| Arrêt du service web | Problème signalé, retour auto après redémarrage | Conforme |
| Coupure d'un port du switch | Variation de trafic visible dans Grafana | Conforme |
5. Difficultés rencontrées et solutions
- Agent Windows « no active checks » : port 10051 bloqué par le pare-feu. Règle entrante ajoutée.
- SNMP muet sur le switch : communauté erronée ; passage en SNMP v3 (authentification + chiffrement) pour la sécurité.
- Courriels non reçus : relais SMTP exigeant une authentification ; configuration du média avec compte dédié.
- Faux positifs la nuit (sauvegardes) : ajout d'une période de maintenance planifiée.
6. Compétences mobilisées
7. Bilan
La supervision permet désormais d'anticiper les incidents (disques, services) au lieu de les subir. J'ai appris à doser les seuils pour éviter la « fatigue d'alerte » et à sécuriser la collecte (SNMP v3). Perspectives : superviser les onduleurs, ajouter une sonde externe pour tester la disponibilité depuis l'extérieur, et exporter un rapport mensuel de disponibilité (SLA).