Toate proiectele

Rețea pentru producție

Convenience

Diagnosticarea unei rețele instabile fără a opri producția

Am găsit cauza unei rețele instabile, am înlocuit echipamentele care ascundeau problema și am introdus alerte care nu trimit zeci de e-mailuri identice.

Rack-uri de servere și cabluri de rețea într-un centru de date
Situația

Conectivitatea devenise intermitentă în mai multe zone. Simptomele indicau aparent Wi-Fi sau DHCP, dar cauza era în topologia fizică și în echipamentele de acces fără vizibilitate.

Lucrări făcute5 direcții de lucru
După proiectInfrastructură stabilă și documentație clară

Situația

Când mai multe dispozitive pierd simultan accesul la servere și internet, este tentant să fie schimbate adrese, repornite servicii sau adăugate puncte de acces. În acest caz, capacitatea DHCP era suficientă, iar semnalul radio era puternic. Instabilitatea venea dintr-o zonă mai joasă a rețelei.

Rețeaua deservea atât birourile, cât și producția, așa că nu puteam opri totul pentru teste. Am început doar prin a citi configurațiile și starea echipamentelor, fără să schimbăm nimic. Apoi am desenat legăturile și am separat faptele măsurate de presupuneri.

Diagnosticul

Am urmărit traficul transmis către toate dispozitivele, schimbările de legături, viteza negociată și erorile fiecărui port. Testele au indicat un echipament de rețea care nu putea fi administrat sau monitorizat și care producea instabilitate.

Diferența contează. O problemă DHCP împiedică dispozitivul să primească o adresă IP. O problemă în rețeaua cablată poate întrerupe aleatoriu și dispozitive care au deja o adresă corectă.

  • măsurare înainte de schimbare
  • izolare pe segmente, cu verificare după fiecare pas
  • verificare prin trafic real, nu doar din interfața de administrare
  • o variantă de revenire pentru fiecare modificare importantă

Remedierea

Am înlocuit echipamentele care nu puteau fi urmărite cu switch-uri administrabile și am configurat porturile după rol. Legăturile dintre switch-uri au primit alte reguli decât porturile pentru calculatoare și utilaje, astfel încât protecțiile rețelei să nu blocheze trafic legitim.

După stabilizare am introdus un sistem de monitorizare care ține minte dacă problema este nouă, încă activă sau rezolvată. Trimite o notificare când apare incidentul, când revine la normal ori când rămâne nerezolvat prea mult timp. Pentru aceeași stare nu mai trimite e-mailuri repetate.

Ce rămâne după incident

Rezultatul nu este doar o rețea care funcționează din nou. Clientul are acum o schemă ușor de urmărit, un tabel al porturilor, reguli pentru mutarea echipamentelor și alerte care fac diferența între o defecțiune și o lucrare planificată.

Ai o problemă asemănătoare?

Te putem ajuta să înțelegi ce este afectat și ce trebuie verificat mai întâi.

Discută proiectul