CPU و بار سیستم
آیا پردازنده واقعاً کم است یا یک پردازه آن را اشغال کرده؟
- میانگین load در مقایسه با تعداد هستهها
- پردازههایی که بیشترین مصرف را دارند
- نشانههای steal time و کمبود منابع در سرور مجازی
مانیتورینگ سرور رایگان در کانفیگ سرور یک بررسی سلامت دستی است، نه ابزار آنلاین خودکار یا داشبورد دائمی. درخواست را در تلگرام میفرستید، کارشناس وضعیت CPU، رم، دیسک، آپتایم، سرویسها، گواهی SSL و بکاپ سرور شما را رایگان بررسی میکند و گزارشی کوتاه با اولویتبندی مشکلات تحویل میدهد.
این تست سلامت سرور منابع سختافزاری، در دسترس بودن، سرویسهای اصلی، گواهی SSL و وضعیت بکاپ را پوشش میدهد تا مشکلاتی که هنوز به قطعی نرسیدهاند پیدا شوند.
آیا پردازنده واقعاً کم است یا یک پردازه آن را اشغال کرده؟
کمبود حافظه معمولاً خودش را با توقف ناگهانی سرویسها نشان میدهد.
پر شدن دیسک از رایجترین علتهای از کار افتادن سایت و دیتابیس است.
سرور روشن است، اما آیا از بیرون هم در دسترس است؟
سرویسی که بیصدا متوقف و دوباره اجرا میشود، نشانه مشکل است.
دو موردی که معمولاً فقط وقتی از کار افتادهاند به یاد میآیند.
مانیتورینگ سرور رایگان در کانفیگ سرور یک بررسی سلامت یکباره است: کارشناس خروجی چند دستور و لاگ سرور را میخواند و گزارشی مینویسد که مشکلات را به ترتیب اولویت آورده است. این بررسی برای مدیری مناسب است که سرورش کار میکند ولی نمیداند کندیهای گاهبهگاه، پر شدن تدریجی دیسک یا ریاستارتهای بیدلیل از کجا میآیند. گزارش تصویر همان روز را نشان میدهد و جای پایش پیوسته را نمیگیرد. بخشهای زیر توضیح میدهند در بررسی سلامت چه عددهایی خوانده میشوند، این کار چطور بدون رمز root انجام میشود و بعد از گزارش چه ابزاری برای پایش دائمی به کار میآید.
عدد load average بهتنها معنایی ندارد و باید با تعداد هستههای پردازنده مقایسه شود. load برابر ۴ روی سروری با دو هسته یعنی پردازهها در صف ماندهاند، ولی روی سرور هشتهستهای بار معمولی است. اگر load بالاست و CPU بیکار به نظر میرسد، پردازهها احتمالاً منتظر دیسک هستند و مشکل از I/O است. در سرور مجازی، steal time بالا نشان میدهد میزبان فیزیکی زیر بار است و بخشی از زمان پردازنده به ماشین شما نمیرسد. این مشکل با تنظیمات داخل سرور حل نمیشود و باید با ارائهدهنده در میان گذاشته شود.
حافظهای که پر به نظر میرسد همیشه کمبود حافظه نیست، چون لینوکس حافظه آزاد را برای cache فایلها به کار میگیرد و هر وقت برنامهای لازم داشته باشد آزادش میکند. عدد مهمتر، حافظه در دسترس (available) و استفاده مداوم از swap است. اگر در لاگ سیستم رخداد OOM Killer ثبت شده، کرنل برای جلوگیری از قفل شدن سرور یک پردازه را بسته است و معمولاً پرمصرفترین پردازه، مثل MySQL، قربانی میشود. دیسک هم دو سقف دارد: فضای آزاد و inode. پارتیشنی که فضای خالی دارد ولی inodeهایش با انبوه فایلهای کوچک session یا cache تمام شده، همان خطای پر بودن دیسک را میدهد.
بیشتر این عددها با دستورات فقطخواندنی به دست میآیند. در لینوکس، uptime بار سیستم و مدت روشن بودن را نشان میدهد، free -m وضعیت حافظه را، df -h و df -i فضای دیسک و inode را، و systemctl –failed سرویسهایی را که متوقف شدهاند. این دستورات را خودتان اجرا میکنید و خروجی را پیش از ارسال میبینید. اگر بررسی لاگها یا وضعیت RAID دسترسی بیشتری بخواهد، یک کاربر موقت با کلید SSH و دسترسی محدود میسازید که بعد از تحویل گزارش حذف میشود.
در ویندوز سرور همین موارد با خروجی PowerShell، رویدادهای Event Viewer و وضعیت سرویسها بررسی میشوند. در دسترس بودن سایت، پورتهای اصلی و زنجیره گواهی SSL هم از بیرون سرور سنجیده میشوند، چون سروری که از داخل سالم است ممکن است بهدلیل فایروال یا DNS از بیرون در دسترس نباشد. اگر سرور در ایران است و کاربرانی بیرون از ایران هم دارید، در دسترس بودن سایت را از هر دو مسیر امتحان کنید، چون اختلال لینک بینالملل گاهی فقط یکی از آنها را قطع میکند.
گزارش بررسی سلامت وضعیت امروز سرور را نشان میدهد، ولی دیسکی که هفته بعد پر میشود یا گواهیای که ماه بعد منقضی میشود را فقط پایش پیوسته میگیرد. برای سایت یا چند سرویس ساده، Uptime Kuma در دسترس بودن HTTP، TCP، Ping و DNS و انقضای گواهی SSL را بررسی میکند و هشدار میفرستد. این ابزار باید روی سروری جدا نصب شود، وگرنه با قطعی سرور اصلی خودش هم از کار میافتد. Netdata برای دیدن لحظهای منابع و عیبیابی کندی مناسب است، به شرط اینکه داشبوردش پشت رمز یا VPN باشد.
وقتی چند سرور و تجهیزات شبکه دارید، Zabbix با agent برای لینوکس و ویندوز و SNMP برای تجهیزات شبکه همه را در یک سامانه جمع میکند. مراحل نصب آن را در کانفیگ سرور Zabbix روی اوبونتو نوشتهایم و ابزارهای دیگر را در معرفی بیش از ۱۰ ابزار مانیتورینگ سرور مقایسه کردهایم. اگر کسی در تیم برای خواندن هشدارها و پیگیری علتشان وقت ندارد، پایش مستمر و نگهداری را میتوانید به مدیریت زیرساخت IT بسپارید.
رایجترین واکنش به سرور کند، خرید رم یا CPU بیشتر است، در حالی که گزارش ممکن است نشان دهد گلوگاه دیسک یا یک کوئری کند دیتابیس است. پیش از ارتقای منابع علت کندی را پیدا کنید؛ این کار در بهینهسازی سرور انجام میشود. اشتباه دیگر پاک کردن دستی لاگها برای آزاد کردن فضاست، که چند هفته بعد دوباره به همان نقطه میرسد چون logrotate تنظیم نشده است. بکاپی هم که فقط روی دیسک همان سرور نگهداری میشود، با خرابی دیسک یا نفوذ همراه دادهها از دست میرود و دستکم یک نسخه باید بیرون از سرور باشد.
رمز root، Administrator یا کنترلپنل را در تلگرام نفرستید. برای بیشتر بررسیها خروجی دستورات فقطخواندنی کافی است و اگر دسترسی لازم شد، کاربر موقت و محدود بسازید و بعد از دریافت گزارش حذفش کنید.
گزارش کوتاه و قابل اقدام است و مشکلات را به ترتیب اولویت میآورد. یافتههای جدول زیر فقط برای نمایش قالب گزارشاند.
| بخش گزارش | چه چیزی در آن میآید | نمونه یافته |
|---|---|---|
| خلاصه وضعیت | وضعیت کلی در سه سطح: مناسب، نیازمند توجه، بحرانی | نیازمند توجه؛ دو مورد با اولویت بالا |
| منابع سرور | مصرف CPU، RAM و دیسک و نشانههای کمبود | پارتیشن /var نزدیک به پرشدن است؛ علت اصلی لاگهای چرخشنیافته |
| سرویسها و آپتایم | سرویسهای متوقف یا ناپایدار و ریاستارتهای اخیر | MySQL در هفته گذشته چند بار به دلیل کمبود حافظه متوقف شده |
| SSL و بهروزرسانی | انقضای گواهی و وصلههای امنیتی معوق | گواهی SSL دامنه اصلی بهزودی منقضی میشود و تمدید آن خودکار نیست |
| بکاپ | آخرین بکاپ موفق و محل نگهداری | بکاپ فقط روی دیسک همان سرور نگهداری میشود |
| پیشنهادهای عملی | اقدامات به ترتیب اولویت که تیم خودتان هم میتواند انجام دهد | تنظیم logrotate و انتقال نسخه بکاپ به فضای خارج از سرور |
سیستمعامل سرور، نوع میزبانی (سرور مجازی، اختصاصی یا داخل سازمان)، سرویس اصلی مثل سایت یا دیتابیس و مشکلی را که احساس میکنید برای پشتیبانی کانفیگ سرور بنویسید.
یا فهرستی از دستورات فقطخواندنی برایتان میفرستیم تا اجرا کنید و خروجی را ارسال کنید، یا یک کاربر موقت با دسترسی محدود و کلید SSH میسازید که پس از بررسی حذف میشود.
خروجیها و لاگها تحلیل میشوند و در دسترس بودن سایت، پورتها و گواهی SSL از بیرون سرور هم بررسی میشود.
گزارش اولویتبندیشده را دریافت میکنید. میتوانید مشکلات را خودتان رفع کنید یا برای رفع آنها از خدمات کانفیگ سرور استعلام بگیرید؛ هیچ تعهدی ایجاد نمیشود.
این بررسی بخشی از ابزارهای رایگان سرور کانفیگ سرور است. برای بیشتر موارد به دسترسی مستقیم نیازی نیست و هرگز از شما نمیخواهیم رمز root یا Administrator را در تلگرام بفرستید.
بخش بزرگی از بررسی با خروجی دستوراتی انجام میشود که خودتان اجرا میکنید و پیش از ارسال میتوانید آنها را ببینید.
اگر دسترسی لازم شد، کاربر موقت با کلید SSH یا حساب محدود میسازید و بلافاصله پس از تحویل گزارش آن را حذف میکنید.
محتوای دیتابیس، ایمیلها و فایلهای کاربران بررسی نمیشود و بررسی فقط به متریکهای سیستم، وضعیت سرویسها و تنظیمات محدود است.
اگر میخواهید سرور را بهطور مستمر زیر نظر داشته باشید، این سه ابزار متنباز بیشتر نیازها را پوشش میدهند. برای مقایسه گزینههای بیشتر، معرفی بیش از ۱۰ ابزار مانیتورینگ سرور را ببینید.
داشبورد لحظهای با متریکهای ثانیهبهثانیه برای یک یا چند سرور.
مانیتورینگ آپتایم سایت و سرویسها با رابط وب ساده.
مانیتورینگ سازمانی چند سرور و تجهیزات شبکه در یک سامانه.
بله، بررسی اولیه و گزارش آن هزینهای ندارد و تعهدی برای خرید خدمت ایجاد نمیکند. اگر برای رفع مشکلات یافتهشده به کمک نیاز داشتید، محدوده کار و استعلام قیمت جداگانه ارائه میشود.
خیر. بررسی را یک کارشناس بهصورت دستی و از طریق تلگرام انجام میدهد و خروجی آن یک گزارش است که داشبورد دائمی ندارد. برای سرویس مانیتورینگ سرور بهصورت مستمر میتوانید ابزارهای رایگان همین صفحه را نصب کنید یا از مدیریت زیرساخت IT استفاده کنید.
به نیاز بستگی دارد: برای دیدن لحظهای منابع یک سرور Netdata، برای مانیتورینگ آپتایم سایت و هشدار قطعی Uptime Kuma، برای چند سرور و تجهیزات شبکه Zabbix و برای سرویسهای کانتینری Prometheus همراه با Grafana مناسبتر است.
Uptime Kuma یک ابزار متنباز و سبک برای بررسی در دسترس بودن سایتها و سرویسها و ارسال هشدار است. Zabbix سامانه کاملتری است که علاوه بر آپتایم، منابع داخلی سرورها و تجهیزات شبکه را هم پایش میکند، اما راهاندازی و نگهداری آن تخصص بیشتری میخواهد.
خیر. در بیشتر موارد خروجی چند دستور فقطخواندنی کافی است. اگر دسترسی لازم شود، یک کاربر موقت و محدود میسازید و پس از دریافت گزارش آن را حذف میکنید.
بله. برای ویندوز سرور همین موارد با خروجی PowerShell، Event Viewer و وضعیت سرویسها بررسی میشود. برای نگهداری مستمر آن، صفحه مدیریت ویندوز سرور را ببینید.
سیستمعامل سرور، نوع میزبانی و سرویس اصلی آن را در تلگرام بنویسید تا کارشناس کانفیگ سرور روش بررسی را هماهنگ کند و گزارش مانیتورینگ سرور رایگان شما را آماده کند.