مدیریت و پشتیبانی · پایش پیشگیرانه

مدیریت زیرساخت IT با پایش پیشگیرانه

در خدمت مدیریت زیرساخت IT کانفیگ سرور، سرورها، ماشین‌های مجازی، تجهیزات شبکه و بکاپ‌های شما پیوسته پایش می‌شوند و کارشناس پیش از آنکه پر شدن دیسک، خرابی هارد یا انقضای گواهی SSL به قطعی برسد، اقدام می‌کند. این خدمت لایه پیشگیرانه‌ای روی پشتیبانی و مدیریت سرور است.

Zabbix · Prometheus · Grafana Nagios · SNMP Linux · Windows Server VMware · Proxmox
چه زمانی به این خدمت نیاز دارید؟

وقتی همیشه بعد از قطعی متوجه مشکل می‌شوید

مشتری زودتر از ما متوجه قطعی سایت یا سامانه می‌شود

وقتی پایش و هشدار تعریف نشده، اولین خبر قطعی تماس مشتری یا همکار است. برای سرویس‌ها، پورت‌ها و صفحات اصلی بررسی مستمر تعریف می‌کنیم و هشدار را به فرد درست می‌رسانیم.

دیسک پر شد، هارد خراب شد و بکاپ هم کار نمی‌کرد

بیشتر این رخدادها چند روز قبل نشانه می‌دهند: رشد تدریجی مصرف دیسک، خطاهای SMART، آرایه RAID تخریب‌شده یا job بکاپی که بی‌صدا شکست خورده است. پایش پیشگیرانه سرور همین نشانه‌ها را می‌گیرد.

کل زیرساخت به یک نفر وابسته است

اگر تنها کارشناس IT سازمان در دسترس نباشد، کسی نمی‌داند کدام سرویس به کدام سرور وابسته است. زیرساخت را فهرست و مستند می‌کنیم و برای رخدادهای رایج دستورالعمل می‌نویسیم.

خدمات مدیریت زیرساخت

مدیریت زیرساخت IT در کانفیگ سرور شامل چه کارهایی است؟

این خدمت چهار بخش دارد: نظارت مستمر زیرساخت شامل سرور، شبکه، مجازی‌سازی و بکاپ، پیگیری هشدارها تا یافتن علت، نگهداری پیشگیرانه در زمان توافق‌شده و گزارش روند مصرف منابع برای تصمیم درباره ارتقا.

پایش پیشگیرانه سرور و سرویس‌ها

آستانه هشدار هر سرور بر اساس نقش آن تنظیم می‌شود و مقادیر پیش‌فرض ابزار کنار گذاشته می‌شوند.

  • CPU، حافظه، I/O و فضای دیسک، همراه با روند مصرف در کنار عدد لحظه‌ای
  • در دسترس بودن وب‌سایت، پورت‌ها و سرویس‌های اصلی مثل دیتابیس و ایمیل
  • هشدار پیش از انقضای گواهی SSL
  • هشدار پیش از انقضای دامنه

سلامت سخت‌افزار و مجازی‌سازی

خرابی سخت‌افزار معمولاً تدریجی است و پیش از توقف کامل نشانه می‌دهد.

  • وضعیت RAID و خطاهای SMART دیسک‌ها
  • سنسورهای دما، فن و منبع تغذیه از طریق iLO یا iDRAC در سرورهای HPE و Dell
  • پایش هاست‌ها، datastoreها و ماشین‌های مجازی روی VMware و Proxmox

مانیتورینگ زیرساخت شبکه

بخشی از قطعی‌ها از لینک، سوئیچ یا فایروال شروع می‌شوند.

  • ترافیک و وضعیت پورت‌های سوئیچ و روتر از طریق SNMP
  • پایش لینک اینترنت و ارتباط بین شعب
  • هشدار روی قطع تونل VPN یا تغییر وضعیت فایروال

کنترل بکاپ و آمادگی بازیابی

تا بازیابی آزمایش نشود، معلوم نیست بکاپ سالم است.

  • بررسی نتیجه jobهای بکاپ، علاوه بر زمان‌بندی آن‌ها
  • تست دوره‌ای بازیابی روی نمونه‌ای از داده‌ها
  • هشدار وقتی آخرین بکاپ موفق از حد مجاز قدیمی‌تر شده است

نگهداری پیشگیرانه

وصله، چرخش لاگ و بازبینی دسترسی‌ها اگر عقب بیفتند، دیر یا زود به رخداد می‌رسند.

  • اعمال وصله‌های امنیتی لینوکس و ویندوز سرور در پنجره زمانی توافق‌شده
  • مدیریت چرخش لاگ و پاک‌سازی فایل‌های موقت
  • بازبینی دوره‌ای حساب‌های کاربری و دسترسی‌های مدیریتی

برنامه‌ریزی ظرفیت سرور و گزارش

تصمیم ارتقا بر اساس داده مصرف و پیش از رسیدن به سقف منابع گرفته می‌شود.

  • گزارش دوره‌ای روند مصرف منابع، رخدادها و ریسک‌های زیرساخت با اولویت‌بندی
  • پیشنهاد ارتقای دیسک، حافظه یا سرور پیش از بروز کندی
راهنمای کامل

راهنمای مدیریت زیرساخت IT و پایش پیشگیرانه

مدیریت زیرساخت IT برای سازمانی است که چند سرور فیزیکی یا مجازی، تجهیزات شبکه، یک یا چند شعبه و بکاپ‌هایی دارد که هر کدام ممکن است بی‌صدا از کار بیفتند. در پشتیبانی معمول، کار از لحظه‌ای شروع می‌شود که کاربری خبر قطعی می‌دهد. پایش پیشگیرانه داده‌هایی را که پیش از قطعی تغییر می‌کنند زیر نظر می‌گیرد و هشدار را به کسی می‌رساند که باید اقدام کند. بخش‌های زیر نشان می‌دهند این پایش روی چه نشانه‌هایی کار می‌کند، هشدار چطور طراحی می‌شود و چه چیزهایی کار را طولانی‌تر می‌کند.

پایش پیشگیرانه روی چه نشانه‌هایی کار می‌کند؟

بیشتر رخدادهای زیرساخت پیش از قطعی در داده‌ها دیده می‌شوند. فضای دیسکی که هر روز کمی کمتر می‌شود، زمان پر شدنش را از قبل نشان می‌دهد و هشدار روی روند مصرف زودتر از هشدار روی یک عدد ثابت فعال می‌شود. خطاهای SMART و آرایه RAID که یک دیسکش از مدار خارج شده، سرور را هنوز از کار نینداخته‌اند، ولی خرابی دیسک بعدی می‌تواند داده را از بین ببرد. در سرورهای HPE و Dell، کارت iLO یا iDRAC وضعیت دما، فن و منبع تغذیه را هم گزارش می‌کند.

بخشی از نشانه‌ها بیرون از خود سرور هستند. گواهی SSL و دامنه تاریخ انقضای مشخص دارند و هشدار چند هفته پیش از آن فرصت کافی برای تمدید می‌دهد. job بکاپی که شکست خورده معمولاً خطایی جلوی چشم کاربر نمی‌گذارد، پس هشدار باید روی قدیمی شدن آخرین بکاپ موفق تنظیم شود. قطع تونل VPN بین شعب یا تغییر وضعیت پورت سوئیچ هم از طریق SNMP دیده می‌شود. برنامه بکاپ و تست بازیابی در بکاپ و بازیابی بحران طراحی می‌شود و این خدمت اجرای آن را کنترل می‌کند.

طراحی هشدار: آستانه، اولویت و گیرنده

ابزاری که با تنظیمات پیش‌فرض نصب شود، از همان هفته اول هشدارهای زیادی می‌فرستد و تیم کم‌کم خواندن آن‌ها را کنار می‌گذارد. آستانه باید بر اساس نقش سرور تعیین شود: CPU بالای سرور دیتابیس در ساعت بکاپ شبانه طبیعی است، ولی همان عدد روی فایل‌سرور در ساعت کاری نشانه مشکل است. هشدارها اولویت می‌گیرند و برای هر اولویت از قبل مشخص می‌شود از چه راهی، مثل تلگرام یا ایمیل، به چه کسی برسد. در هفته‌های اول آستانه‌ها با رفتار واقعی سیستم تنظیم می‌شوند تا هشدار کاذب هشدار واقعی را پنهان نکند.

در این خدمت کارشناس هر هشدار را بررسی و تا پیدا شدن علت پیگیری می‌کند. ممکن است دیسک با لاگی پر شده باشد که چرخش ندارد، یا سرویسی به‌دلیل کمبود حافظه متوقف شده باشد. رفع علت، مثل تنظیم چرخش لاگ یا برنامه ارتقای حافظه، در گزارش دوره ثبت می‌شود تا همان هشدار ماه بعد تکرار نشود.

فهرست دارایی‌ها، وابستگی‌ها و دستورالعمل رخداد

پایش بدون فهرست زیرساخت ناقص می‌ماند، چون سروری که کسی از آن خبر ندارد پایش هم نمی‌شود. فهرست‌برداری سرورها، ماشین‌های مجازی، datastoreها، تجهیزات شبکه، سرویس‌ها و بکاپ‌ها را در بر می‌گیرد و مشخص می‌کند هر سرویس به کدام سرور و کدام لینک وابسته است. همین وابستگی‌ها نشان می‌دهند خرابی یک میزبان Proxmox یا VMware کدام سامانه‌ها را متوقف می‌کند، و اولویت هشدار هر میزبان هم از همین‌جا تعیین می‌شود.

برای رخدادهای رایج، مثل پر شدن دیسک، قطع لینک یک شعبه یا خرابی دیسک در آرایه RAID، دستورالعمل مکتوب نوشته می‌شود. این دستورالعمل‌ها و تنظیمات پایش تحویل سازمان می‌شوند تا اگر تنها کارشناس IT در دسترس نبود، کس دیگری بتواند قدم‌های اول را بردارد.

ابزار پایش را کجا و چطور راه بیندازیم؟

Zabbix برای سرورهای لینوکس و ویندوز و تجهیزات شبکه انتخاب رایجی است، چون هم agent دارد و هم SNMP. Prometheus و Grafana برای متریک‌ها و داشبوردها به کار می‌روند و در بعضی سازمان‌ها Nagios از قبل نصب است. اگر یکی از این ابزارها را دارید، معمولاً همان توسعه داده می‌شود. مراحل راه‌اندازی Zabbix را در آموزش کانفیگ سرور Zabbix نوشته‌ایم.

سرور پایش باید جدا از سرورهایی باشد که پایش می‌کند، وگرنه با از کار افتادن همان سرور، هشدار قطعی هم ارسال نمی‌شود. داده‌های پایش روی زیرساخت خود سازمان می‌مانند و دسترسی کارشناس از مسیری امن مثل VPN است. اگر سرویس‌ها داخل ایران هستند و سرور پایش در دیتاسنتری خارج از ایران، اختلال لینک بین‌الملل ممکن است هشدار قطعی کاذب بسازد. لاگ متمرکز و Observability اپلیکیشن پروژه جداگانه‌ای است که در خدمات مانیتورینگ و Observability انجام می‌شود.

زمان و هزینه مدیریت زیرساخت IT به چه بستگی دارد؟

تعداد سرورها و تجهیزات، تنوع سیستم‌عامل‌ها و بسترهای مجازی‌سازی و محدوده کارهای نگهداری پایه برآورد هستند. زیرساختی که مستند نیست، در مرحله فهرست‌برداری زمان بیشتری می‌گیرد. اگر ابزار پایش از قبل نصب است راه‌اندازی کوتاه‌تر می‌شود، هرچند آستانه‌ها و قالب‌های قدیمی باید بازبینی شوند. سرورهای قدیمی بدون کارت مدیریت یا تجهیزاتی که SNMP ندارند روش جایگزین پایش می‌خواهند. قیمت پس از بررسی اولیه رایگان اعلام می‌شود و اگر فقط تصویر یک‌باره‌ای از وضعیت یک سرور لازم دارید، بررسی رایگان سلامت سرور را درخواست کنید.

پیش از فعال کردن هشدارها، فهرست گیرندگان و ساعت‌هایی را که هر نفر پاسخ‌گوست مشخص کنید. هشداری که نیمه‌شب به گوشی کسی می‌رسد که در آن ساعت مسئولیتی ندارد، خیلی زود بی‌صدا می‌شود.

پایش پیشگیرانه در برابر پشتیبانی واکنشی

در پشتیبانی واکنشی، که مدل رایج بسیاری از خدمات پشتیبانی شبکه و سرور است، کار از لحظه گزارش مشکل شروع می‌شود. در مدیریت پیشگیرانه زیرساخت، هدف این است که مشکل به کاربر نرسد.

مقایسه دو رویکرد نگهداری زیرساخت IT
موضوعپشتیبانی واکنشیپایش پیشگیرانه زیرساخت
زمان شناسایی مشکلپس از گزارش کاربر یا قطعیبا اولین نشانه در داده‌های پایش
بکاپهنگام نیاز معلوم می‌شود سالم است یا نهنتیجه jobها و تست بازیابی کنترل می‌شود
ارتقای منابعپس از کندی یا پرشدن دیسکبر اساس روند مصرف و از قبل برنامه‌ریزی‌شده
مستنداتمعمولاً پراکنده یا در ذهن یک نفرفهرست دارایی‌ها، وابستگی‌ها و دستورالعمل رخداد
مناسب برایسرورهای کم‌اهمیت یا محیط آزمایشیسامانه‌هایی که قطعی آن‌ها هزینه مستقیم دارد
فرآیند اجرای کار

راه‌اندازی مدیریت زیرساخت IT در چهار گام

شناخت و فهرست‌برداری زیرساخت

سرورها، ماشین‌های مجازی، تجهیزات شبکه، سرویس‌ها، بکاپ‌ها و وابستگی میان آن‌ها را فهرست می‌کنیم و با شما مشخص می‌کنیم قطعی کدام سامانه کار سازمان را متوقف می‌کند.

طراحی پایش و مسیر هشدار

ابزار مناسب را انتخاب می‌کنیم و اگر Zabbix یا Prometheus دارید، معمولاً همان را توسعه می‌دهیم. آستانه‌ها، اولویت هشدارها و اینکه هر هشدار از چه راهی به چه کسی برسد، از قبل تعیین می‌شود.

پیاده‌سازی و تنظیم دقیق

agentها و SNMP راه‌اندازی و داشبوردهای Grafana ساخته می‌شوند. در هفته‌های اول آستانه‌ها را با رفتار واقعی سیستم تنظیم می‌کنیم تا هشدارهای کاذب باعث نادیده‌گرفتن هشدارهای واقعی نشوند.

پایش، نگهداری و بازبینی

هشدارها بررسی و تا یافتن علت پیگیری می‌شوند، نگهداری طبق تقویم توافق‌شده انجام می‌شود و در بازبینی‌های دوره‌ای، گزارش روند منابع و دستورالعمل‌ها به‌روز می‌شوند.

محدوده خدمت مدیریت و پایش زیرساخت

شامل این خدمت

  • پایش سرورهای لینوکس و ویندوز سرور، ماشین‌های مجازی و سرویس‌های اصلی
  • راه‌اندازی یا تنظیم Zabbix، Prometheus، Grafana یا Nagios
  • بررسی هشدارها و تعیین علت ریشه‌ای رخدادها
  • کنترل نتیجه بکاپ‌ها و تست دوره‌ای بازیابی
  • نگهداری پیشگیرانه و وصله‌های امنیتی در زمان توافق‌شده
  • مستندسازی زیرساخت و دستورالعمل رخدادهای رایج

خارج از این خدمت

چرا کانفیگ سرور؟

پایش زیرساخت همراه با پیگیری هشدار تا رفع علت

نصب ابزار مانیتورینگ بخش کوچکی از کار است. در این خدمت کارشناس هشدارها را می‌خواند، علت را پیدا می‌کند و جلوی تکرار را می‌گیرد. اگر می‌خواهید پیش از همکاری با مفاهیم آشنا شوید، راهنمای مانیتورینگ سرور را ببینید.

01

ابزارهای متن‌باز، داده روی سرور خودتان

با Zabbix، Prometheus، Grafana و Nagios کار می‌کنیم؛ داده‌های پایش روی زیرساخت شما می‌ماند و به سرویس خارجی وابسته نمی‌شوید.

02

پوشش لینوکس و ویندوز

از سرورهای Ubuntu و AlmaLinux تا Windows Server و Active Directory؛ لازم نیست برای هر سیستم‌عامل سراغ تیم دیگری بروید.

03

مستندات تحویل‌شده به سازمان

فهرست دارایی‌ها، تنظیمات پایش و دستورالعمل‌ها به شما تحویل می‌شود تا زیرساخت به یک شخص یا یک شرکت گره نخورد.

04

دانش منتشرشده

آموزش کانفیگ سرور Zabbix و راهنماهای Prometheus و Grafana روی همین سایت منتشر شده‌اند.

سوالات متداول

پرسش‌های رایج درباره مدیریت زیرساخت IT

مدیریت زیرساخت IT چیست و چه بخش‌هایی را شامل می‌شود؟

مدیریت زیرساخت IT یعنی نگهداری و نظارت مستمر بر سرورها، مجازی‌سازی، شبکه، ذخیره‌سازی و بکاپ به‌گونه‌ای که سرویس‌های سازمان پایدار بمانند. در کانفیگ سرور تمرکز این خدمت روی پایش پیشگیرانه، پیگیری هشدارها، نگهداری منظم و مستندسازی است.

تفاوت این خدمت با پشتیبانی و مدیریت سرور چیست؟

تفاوت در دامنه و رویکرد است. در پشتیبانی و مدیریت سرور کارها بر اساس درخواست یا نیاز روی سرورها انجام می‌شوند، و مدیریت زیرساخت IT یک لایه بالاتر است که پایش مستمر، هشدار پیش از قطعی، کنترل بکاپ و برنامه‌ریزی ظرفیت را برای کل زیرساخت انجام می‌دهد.

هزینه یا تعرفه خدمات مدیریت زیرساخت IT چگونه تعیین می‌شود؟

تعرفه ثابتی برای همه سازمان‌ها وجود ندارد. تعداد سرورها و تجهیزات، اهمیت سامانه‌ها برای کار سازمان و محدوده کارهای نگهداری تعیین‌کننده‌اند. پس از بررسی اولیه رایگان در تلگرام، محدوده کار و استعلام قیمت را ارائه می‌کنیم.

قرارداد مدیریت زیرساخت معمولاً شامل چه مواردی است؟

قرارداد معمولاً فهرست دارایی‌ها و سرویس‌های تحت پایش، مسیر و اولویت هشدارها، پنجره‌های زمانی نگهداری، نوع دسترسی‌ها، شکل گزارش‌دهی و پارامترهای توافق سطح خدمت را مشخص می‌کند. جزئیات هر مورد پیش از شروع همکاری با شما تعیین می‌شود.

برای مانیتورینگ زیرساخت از چه ابزاری استفاده می‌کنید؟

معمولاً Zabbix برای سرورها و تجهیزات شبکه، Prometheus و Grafana برای متریک‌ها و داشبوردها، و در برخی محیط‌ها Nagios. اگر ابزار دیگری از قبل دارید، ابتدا امکان ادامه کار با همان را بررسی می‌کنیم.

آیا سرورها باید روی زیرساخت کانفیگ سرور باشند؟

خیر. زیرساخت می‌تواند در اتاق سرور سازمان، مرکز داده یا سرویس ابری دیگری باشد. کافی است یک مسیر دسترسی امن، مثل VPN، برای پایش و نگهداری فراهم شود.

زیرساخت خود را پیش از قطعی بعدی زیر نظر بگیرید

تعداد سرورها، سیستم‌عامل‌ها، بستر مجازی‌سازی، ابزار پایش فعلی و رخدادهای اخیر را در تلگرام بنویسید. کارشناس کانفیگ سرور بررسی اولیه رایگان انجام می‌دهد و مدیریت زیرساخت IT متناسب با سازمان شما را پیشنهاد می‌کند.