Previous incidents

April 2026
Apr 23, 2026
1 incident

Incident cluster kube en DC02

Resolved

Resolved Apr 23, 2026 at 8:28am UTC

DC02 de nouveau UP, La fibre principale a coupé en DC02 entre 4h55 et 5h, tous les tunnels IPsec sont tombés et quand il sont remonté les routes se se sont pas propagées sur la gateway principale, j'ai coupé puis réactivé les tunnels, les routes sont bien revenues

1 previous update

Apr 21, 2026
2 incidents

console.france-nuage.fr, Métriques (metrics), and 1 other service are down

Resolved

Resolved Apr 21, 2026 at 11:55pm UTC

console.france-nuage.fr recovered.

21 previous updates

Interruption connexion fibre principale en DC01

Resolved

Resolved Apr 21, 2026 at 2:29am UTC

Interruption de la connexion fibre principale en DC01 pendant 30 secondes. Plusieurs applications kube tournant sur les noeuds de ce DC ont été relocalisées ailleurs.

Apr 20, 2026
2 incidents

Métriques (metrics) and Journaux (logs) are down

Resolved

Resolved Apr 20, 2026 at 4:10am UTC

Métriques (metrics) recovered.

3 previous updates

Surcharge réseau 10 minutes DC02

Resolved

Resolved Apr 20, 2026 at 4:00am UTC

Nous avons eu une cascade de surcharge sur l'UDM pro en DC02 suite au gonflage due système de journalisation. Il a chargé la RAM au point de la saturer jusqu'au SWAP, dès le début du SWAPPING le CPU est monté à 80%+ à cause des iowait et ça a commencé à impacter les fluxs réseau (plage 6h à 6h09), l'udm à ensuite kill le process ulogd et le réseau s'est restabilisé vers 6h10.

Apr 19, 2026
1 incident

console.france-nuage.fr is down

Resolved

Resolved Apr 19, 2026 at 3:08pm UTC

console.france-nuage.fr recovered.

1 previous update

Apr 14, 2026
1 incident

Migration Grafana postgres vers CNPG

Resolved

Resolved Apr 14, 2026 at 8:00am UTC

Afin de migrer les bases postgres bitnami standalone sur storageclass ceph-rbd vers du cnpg répliqué avec storageclass local, des coupures de quelques minutes sont à prévoir sur les instances de Grafana ce matin et début d'après midi.

Apr 10, 2026
1 incident

Passage de l'uplink de 1gb/s à 10gb/s en DC02 et DC03

Resolved

Resolved Apr 10, 2026 at 1:45pm UTC

Notre routage sous jacent qui est passé de 1gb/s à 10gb/s sur les Proxmoxs à 15h, ça n'aurait pas du causer d'interruption mais il y a eu une plage de 5-10 minutes vers 15h45 de bascule réseau dans la couche virtualisation des VMs. Certaines ont été impactées d'autres non.

Apr 09, 2026
1 incident

console.france-nuage.fr, Métriques (metrics), and 1 other service are down

Resolved

Resolved Apr 9, 2026 at 7:30pm UTC

console.france-nuage.fr recovered.

39 previous updates

Apr 07, 2026
1 incident

Incident général en DC03

Resolved

Resolved Apr 8, 2026 at 7:40am UTC

Les sauvegardes étaient un peu plus lentes cette nuit générant de la pression IO sur certaines VMs. Nous avons eu à en redémarrer de force une seule pour le moment. N'hésitez pas à nous remonter tout problème d'accès à vos VM en DC03.

3 previous updates

Apr 04, 2026
1 incident

Métriques (metrics) and Serveurs de sauvegarde managé (backup) are down

Resolved

Resolved Apr 4, 2026 at 2:28pm UTC

Métriques (metrics) recovered.

7 previous updates

Apr 03, 2026
1 incident

Gestionnaire de mot de passe managé (vault) is down

Resolved

Resolved Apr 3, 2026 at 2:20pm UTC

Gestionnaire de mot de passe managé (vault) recovered.

1 previous update

Apr 01, 2026
1 incident

Métriques (metrics) and Journaux (logs) are down

Resolved

Resolved Apr 1, 2026 at 1:38am UTC

Métriques (metrics) recovered.

4 previous updates

March 2026
Mar 31, 2026
2 incidents

france-nuage.fr, Journaux (logs), and 3 other services are down

Resolved

Resolved Mar 31, 2026 at 3:32pm UTC

Gestionnaire de mot de passe managé (vault) recovered.

54 previous updates

Pression backup CNPG

Resolved

Resolved Mar 31, 2026 at 6:50am UTC

Les backups CNPG on causé de la pression disque sur nos noeuds kube, engendrant des kill de pods et relocalisation sur d'autres noeuds.
De gros ralentissements ont été observés entre 3h et 8h ce 31 mars 2026.

Mar 26, 2026
1 incident

Métriques (metrics) and Journaux (logs) are down

Resolved

Resolved Mar 26, 2026 at 2:03am UTC

Journaux (logs) recovered.

7 previous updates

Mar 22, 2026
1 incident

Métriques (metrics) is down

Resolved

Resolved Mar 22, 2026 at 10:15am UTC

Métriques (metrics) recovered.

1 previous update

Mar 06, 2026
1 incident

Métriques (metrics), france-nuage.fr, and 2 other services are down

Resolved

Resolved Mar 6, 2026 at 2:08pm UTC

Métriques (metrics) recovered.

46 previous updates

Mar 04, 2026
1 incident

Serveurs de sauvegarde managé (backup) is down

Resolved

Resolved Mar 4, 2026 at 3:19am UTC

Serveurs de sauvegarde managé (backup) recovered.

1 previous update

Mar 03, 2026
1 incident

Métriques (metrics), france-nuage.fr, and 1 other service are down

Resolved

Resolved Mar 3, 2026 at 1:35pm UTC

Métriques (metrics) recovered.

27 previous updates

Mar 02, 2026
1 incident

Métriques (metrics) is down

Resolved

Resolved Mar 2, 2026 at 8:10pm UTC

Métriques (metrics) recovered.

1 previous update

February 2026
Feb 28, 2026
1 incident

Serveurs de sauvegarde managé (backup) is down

Resolved

Resolved Feb 28, 2026 at 11:22am UTC

Serveurs de sauvegarde managé (backup) recovered.

3 previous updates

Feb 27, 2026
1 incident

Métriques (metrics) and Serveurs de sauvegarde managé (backup) are down

Resolved

Resolved Feb 27, 2026 at 4:06pm UTC

Serveurs de sauvegarde managé (backup) recovered.

3 previous updates

Feb 15, 2026
1 incident

Traces (traces) is down

Resolved

Resolved Feb 15, 2026 at 5:39pm UTC

Traces (traces) recovered.

21 previous updates

Feb 14, 2026
1 incident

Traces (traces) is down

Resolved

Resolved Feb 14, 2026 at 10:45pm UTC

Traces (traces) recovered.

19 previous updates

Feb 13, 2026
1 incident

console.france-nuage.fr and Métriques (metrics) are down

Resolved

Resolved Feb 13, 2026 at 6:42am UTC

console.france-nuage.fr recovered.

3 previous updates

Feb 11, 2026
2 incidents

Avancement dans les remises en service

Resolved

Resolved Feb 11, 2026 at 8:33pm UTC

Landing UP et Grafna clients up

On remonte les services un par un via un autre ingress

Resolved

Resolved Feb 11, 2026 at 7:50pm UTC

Le traefik de la stack pangolin sectionne les réponse et bloquait tous traffic client vers les applications.

On a mis en place un autre ingress pour faire remonter les service et investiguer plus sereinement.

Feb 10, 2026
1 incident

Incident Pangolin en cours sur le cluster kube

Resolved

Resolved Feb 11, 2026 at 8:36pm UTC

Remise en fonctionnement des services

1 previous update

Feb 08, 2026
1 incident

Métriques (metrics) is down

Resolved

Resolved Feb 8, 2026 at 8:57am UTC

Métriques (metrics) recovered.

1 previous update

Feb 05, 2026
1 incident

Métriques (metrics), Journaux (logs), and 1 other service are down

Resolved

Resolved Feb 5, 2026 at 7:45am UTC

Métriques (metrics) recovered.

5 previous updates

Feb 02, 2026
1 incident

API compatible OpenAPI is down

Resolved

Resolved Feb 2, 2026 at 7:34pm UTC

API compatible OpenAPI recovered.

1 previous update