مشتری زودتر از ما متوجه قطعی سایت یا سامانه میشود
وقتی پایش و هشدار تعریف نشده، اولین خبر قطعی تماس مشتری یا همکار است. برای سرویسها، پورتها و صفحات اصلی بررسی مستمر تعریف میکنیم و هشدار را به فرد درست میرسانیم.
در خدمت مدیریت زیرساخت IT کانفیگ سرور، سرورها، ماشینهای مجازی، تجهیزات شبکه و بکاپهای شما پیوسته پایش میشوند و کارشناس پیش از آنکه پر شدن دیسک، خرابی هارد یا انقضای گواهی SSL به قطعی برسد، اقدام میکند. این خدمت لایه پیشگیرانهای روی پشتیبانی و مدیریت سرور است.
وقتی پایش و هشدار تعریف نشده، اولین خبر قطعی تماس مشتری یا همکار است. برای سرویسها، پورتها و صفحات اصلی بررسی مستمر تعریف میکنیم و هشدار را به فرد درست میرسانیم.
بیشتر این رخدادها چند روز قبل نشانه میدهند: رشد تدریجی مصرف دیسک، خطاهای SMART، آرایه RAID تخریبشده یا job بکاپی که بیصدا شکست خورده است. پایش پیشگیرانه سرور همین نشانهها را میگیرد.
اگر تنها کارشناس IT سازمان در دسترس نباشد، کسی نمیداند کدام سرویس به کدام سرور وابسته است. زیرساخت را فهرست و مستند میکنیم و برای رخدادهای رایج دستورالعمل مینویسیم.
این خدمت چهار بخش دارد: نظارت مستمر زیرساخت شامل سرور، شبکه، مجازیسازی و بکاپ، پیگیری هشدارها تا یافتن علت، نگهداری پیشگیرانه در زمان توافقشده و گزارش روند مصرف منابع برای تصمیم درباره ارتقا.
آستانه هشدار هر سرور بر اساس نقش آن تنظیم میشود و مقادیر پیشفرض ابزار کنار گذاشته میشوند.
خرابی سختافزار معمولاً تدریجی است و پیش از توقف کامل نشانه میدهد.
بخشی از قطعیها از لینک، سوئیچ یا فایروال شروع میشوند.
تا بازیابی آزمایش نشود، معلوم نیست بکاپ سالم است.
وصله، چرخش لاگ و بازبینی دسترسیها اگر عقب بیفتند، دیر یا زود به رخداد میرسند.
تصمیم ارتقا بر اساس داده مصرف و پیش از رسیدن به سقف منابع گرفته میشود.
مدیریت زیرساخت IT برای سازمانی است که چند سرور فیزیکی یا مجازی، تجهیزات شبکه، یک یا چند شعبه و بکاپهایی دارد که هر کدام ممکن است بیصدا از کار بیفتند. در پشتیبانی معمول، کار از لحظهای شروع میشود که کاربری خبر قطعی میدهد. پایش پیشگیرانه دادههایی را که پیش از قطعی تغییر میکنند زیر نظر میگیرد و هشدار را به کسی میرساند که باید اقدام کند. بخشهای زیر نشان میدهند این پایش روی چه نشانههایی کار میکند، هشدار چطور طراحی میشود و چه چیزهایی کار را طولانیتر میکند.
بیشتر رخدادهای زیرساخت پیش از قطعی در دادهها دیده میشوند. فضای دیسکی که هر روز کمی کمتر میشود، زمان پر شدنش را از قبل نشان میدهد و هشدار روی روند مصرف زودتر از هشدار روی یک عدد ثابت فعال میشود. خطاهای SMART و آرایه RAID که یک دیسکش از مدار خارج شده، سرور را هنوز از کار نینداختهاند، ولی خرابی دیسک بعدی میتواند داده را از بین ببرد. در سرورهای HPE و Dell، کارت iLO یا iDRAC وضعیت دما، فن و منبع تغذیه را هم گزارش میکند.
بخشی از نشانهها بیرون از خود سرور هستند. گواهی SSL و دامنه تاریخ انقضای مشخص دارند و هشدار چند هفته پیش از آن فرصت کافی برای تمدید میدهد. job بکاپی که شکست خورده معمولاً خطایی جلوی چشم کاربر نمیگذارد، پس هشدار باید روی قدیمی شدن آخرین بکاپ موفق تنظیم شود. قطع تونل VPN بین شعب یا تغییر وضعیت پورت سوئیچ هم از طریق SNMP دیده میشود. برنامه بکاپ و تست بازیابی در بکاپ و بازیابی بحران طراحی میشود و این خدمت اجرای آن را کنترل میکند.
ابزاری که با تنظیمات پیشفرض نصب شود، از همان هفته اول هشدارهای زیادی میفرستد و تیم کمکم خواندن آنها را کنار میگذارد. آستانه باید بر اساس نقش سرور تعیین شود: CPU بالای سرور دیتابیس در ساعت بکاپ شبانه طبیعی است، ولی همان عدد روی فایلسرور در ساعت کاری نشانه مشکل است. هشدارها اولویت میگیرند و برای هر اولویت از قبل مشخص میشود از چه راهی، مثل تلگرام یا ایمیل، به چه کسی برسد. در هفتههای اول آستانهها با رفتار واقعی سیستم تنظیم میشوند تا هشدار کاذب هشدار واقعی را پنهان نکند.
در این خدمت کارشناس هر هشدار را بررسی و تا پیدا شدن علت پیگیری میکند. ممکن است دیسک با لاگی پر شده باشد که چرخش ندارد، یا سرویسی بهدلیل کمبود حافظه متوقف شده باشد. رفع علت، مثل تنظیم چرخش لاگ یا برنامه ارتقای حافظه، در گزارش دوره ثبت میشود تا همان هشدار ماه بعد تکرار نشود.
پایش بدون فهرست زیرساخت ناقص میماند، چون سروری که کسی از آن خبر ندارد پایش هم نمیشود. فهرستبرداری سرورها، ماشینهای مجازی، datastoreها، تجهیزات شبکه، سرویسها و بکاپها را در بر میگیرد و مشخص میکند هر سرویس به کدام سرور و کدام لینک وابسته است. همین وابستگیها نشان میدهند خرابی یک میزبان Proxmox یا VMware کدام سامانهها را متوقف میکند، و اولویت هشدار هر میزبان هم از همینجا تعیین میشود.
برای رخدادهای رایج، مثل پر شدن دیسک، قطع لینک یک شعبه یا خرابی دیسک در آرایه RAID، دستورالعمل مکتوب نوشته میشود. این دستورالعملها و تنظیمات پایش تحویل سازمان میشوند تا اگر تنها کارشناس IT در دسترس نبود، کس دیگری بتواند قدمهای اول را بردارد.
Zabbix برای سرورهای لینوکس و ویندوز و تجهیزات شبکه انتخاب رایجی است، چون هم agent دارد و هم SNMP. Prometheus و Grafana برای متریکها و داشبوردها به کار میروند و در بعضی سازمانها Nagios از قبل نصب است. اگر یکی از این ابزارها را دارید، معمولاً همان توسعه داده میشود. مراحل راهاندازی Zabbix را در آموزش کانفیگ سرور Zabbix نوشتهایم.
سرور پایش باید جدا از سرورهایی باشد که پایش میکند، وگرنه با از کار افتادن همان سرور، هشدار قطعی هم ارسال نمیشود. دادههای پایش روی زیرساخت خود سازمان میمانند و دسترسی کارشناس از مسیری امن مثل VPN است. اگر سرویسها داخل ایران هستند و سرور پایش در دیتاسنتری خارج از ایران، اختلال لینک بینالملل ممکن است هشدار قطعی کاذب بسازد. لاگ متمرکز و Observability اپلیکیشن پروژه جداگانهای است که در خدمات مانیتورینگ و Observability انجام میشود.
تعداد سرورها و تجهیزات، تنوع سیستمعاملها و بسترهای مجازیسازی و محدوده کارهای نگهداری پایه برآورد هستند. زیرساختی که مستند نیست، در مرحله فهرستبرداری زمان بیشتری میگیرد. اگر ابزار پایش از قبل نصب است راهاندازی کوتاهتر میشود، هرچند آستانهها و قالبهای قدیمی باید بازبینی شوند. سرورهای قدیمی بدون کارت مدیریت یا تجهیزاتی که SNMP ندارند روش جایگزین پایش میخواهند. قیمت پس از بررسی اولیه رایگان اعلام میشود و اگر فقط تصویر یکبارهای از وضعیت یک سرور لازم دارید، بررسی رایگان سلامت سرور را درخواست کنید.
پیش از فعال کردن هشدارها، فهرست گیرندگان و ساعتهایی را که هر نفر پاسخگوست مشخص کنید. هشداری که نیمهشب به گوشی کسی میرسد که در آن ساعت مسئولیتی ندارد، خیلی زود بیصدا میشود.
در پشتیبانی واکنشی، که مدل رایج بسیاری از خدمات پشتیبانی شبکه و سرور است، کار از لحظه گزارش مشکل شروع میشود. در مدیریت پیشگیرانه زیرساخت، هدف این است که مشکل به کاربر نرسد.
| موضوع | پشتیبانی واکنشی | پایش پیشگیرانه زیرساخت |
|---|---|---|
| زمان شناسایی مشکل | پس از گزارش کاربر یا قطعی | با اولین نشانه در دادههای پایش |
| بکاپ | هنگام نیاز معلوم میشود سالم است یا نه | نتیجه jobها و تست بازیابی کنترل میشود |
| ارتقای منابع | پس از کندی یا پرشدن دیسک | بر اساس روند مصرف و از قبل برنامهریزیشده |
| مستندات | معمولاً پراکنده یا در ذهن یک نفر | فهرست داراییها، وابستگیها و دستورالعمل رخداد |
| مناسب برای | سرورهای کماهمیت یا محیط آزمایشی | سامانههایی که قطعی آنها هزینه مستقیم دارد |
سرورها، ماشینهای مجازی، تجهیزات شبکه، سرویسها، بکاپها و وابستگی میان آنها را فهرست میکنیم و با شما مشخص میکنیم قطعی کدام سامانه کار سازمان را متوقف میکند.
ابزار مناسب را انتخاب میکنیم و اگر Zabbix یا Prometheus دارید، معمولاً همان را توسعه میدهیم. آستانهها، اولویت هشدارها و اینکه هر هشدار از چه راهی به چه کسی برسد، از قبل تعیین میشود.
agentها و SNMP راهاندازی و داشبوردهای Grafana ساخته میشوند. در هفتههای اول آستانهها را با رفتار واقعی سیستم تنظیم میکنیم تا هشدارهای کاذب باعث نادیدهگرفتن هشدارهای واقعی نشوند.
هشدارها بررسی و تا یافتن علت پیگیری میشوند، نگهداری طبق تقویم توافقشده انجام میشود و در بازبینیهای دورهای، گزارش روند منابع و دستورالعملها بهروز میشوند.
نصب ابزار مانیتورینگ بخش کوچکی از کار است. در این خدمت کارشناس هشدارها را میخواند، علت را پیدا میکند و جلوی تکرار را میگیرد. اگر میخواهید پیش از همکاری با مفاهیم آشنا شوید، راهنمای مانیتورینگ سرور را ببینید.
با Zabbix، Prometheus، Grafana و Nagios کار میکنیم؛ دادههای پایش روی زیرساخت شما میماند و به سرویس خارجی وابسته نمیشوید.
از سرورهای Ubuntu و AlmaLinux تا Windows Server و Active Directory؛ لازم نیست برای هر سیستمعامل سراغ تیم دیگری بروید.
فهرست داراییها، تنظیمات پایش و دستورالعملها به شما تحویل میشود تا زیرساخت به یک شخص یا یک شرکت گره نخورد.
آموزش کانفیگ سرور Zabbix و راهنماهای Prometheus و Grafana روی همین سایت منتشر شدهاند.
مدیریت زیرساخت IT یعنی نگهداری و نظارت مستمر بر سرورها، مجازیسازی، شبکه، ذخیرهسازی و بکاپ بهگونهای که سرویسهای سازمان پایدار بمانند. در کانفیگ سرور تمرکز این خدمت روی پایش پیشگیرانه، پیگیری هشدارها، نگهداری منظم و مستندسازی است.
تفاوت در دامنه و رویکرد است. در پشتیبانی و مدیریت سرور کارها بر اساس درخواست یا نیاز روی سرورها انجام میشوند، و مدیریت زیرساخت IT یک لایه بالاتر است که پایش مستمر، هشدار پیش از قطعی، کنترل بکاپ و برنامهریزی ظرفیت را برای کل زیرساخت انجام میدهد.
تعرفه ثابتی برای همه سازمانها وجود ندارد. تعداد سرورها و تجهیزات، اهمیت سامانهها برای کار سازمان و محدوده کارهای نگهداری تعیینکنندهاند. پس از بررسی اولیه رایگان در تلگرام، محدوده کار و استعلام قیمت را ارائه میکنیم.
قرارداد معمولاً فهرست داراییها و سرویسهای تحت پایش، مسیر و اولویت هشدارها، پنجرههای زمانی نگهداری، نوع دسترسیها، شکل گزارشدهی و پارامترهای توافق سطح خدمت را مشخص میکند. جزئیات هر مورد پیش از شروع همکاری با شما تعیین میشود.
معمولاً Zabbix برای سرورها و تجهیزات شبکه، Prometheus و Grafana برای متریکها و داشبوردها، و در برخی محیطها Nagios. اگر ابزار دیگری از قبل دارید، ابتدا امکان ادامه کار با همان را بررسی میکنیم.
خیر. زیرساخت میتواند در اتاق سرور سازمان، مرکز داده یا سرویس ابری دیگری باشد. کافی است یک مسیر دسترسی امن، مثل VPN، برای پایش و نگهداری فراهم شود.
تعداد سرورها، سیستمعاملها، بستر مجازیسازی، ابزار پایش فعلی و رخدادهای اخیر را در تلگرام بنویسید. کارشناس کانفیگ سرور بررسی اولیه رایگان انجام میدهد و مدیریت زیرساخت IT متناسب با سازمان شما را پیشنهاد میکند.