سایت باز نمیشود یا خطای 502 و 503 میدهد
معمولاً یعنی وبسرور، PHP-FPM یا دیتابیس پاسخ نمیدهد، منابع سرور تمام شده یا گواهی SSL و DNS بههم خورده است. زنجیره درخواست را از DNS تا اپلیکیشن دنبال میکنیم تا نقطه قطع مشخص شود.
پشتیبانی فوری سرور و شبکه برای وقتی است که سایت از دسترس خارج شده، SSH یا ریموت دسکتاپ وصل نمیشود یا سرویسها پشتسرهم از کار میافتند. تیم کانفیگ سرور علت قطعی را از لایه شبکه تا سرویسها و لاگها ردیابی میکند، سرویس را با کمترین تغییر به مدار برمیگرداند و علت ریشهای را مکتوب تحویل میدهد.
معمولاً یعنی وبسرور، PHP-FPM یا دیتابیس پاسخ نمیدهد، منابع سرور تمام شده یا گواهی SSL و DNS بههم خورده است. زنجیره درخواست را از DNS تا اپلیکیشن دنبال میکنیم تا نقطه قطع مشخص شود.
قفل شدن پشت فایروال یا CSF، تغییر پورت، پر شدن دیسک یا مشکل تنظیمات شبکه بعد از ریبوت از رایجترین علتهاست. از کنسول دیتاسنتر وارد میشویم و دسترسی را بدون پاک کردن تنظیمات امنیتی برمیگردانیم.
مصرف کامل CPU یا رم، فعال شدن OOM Killer، پر شدن inode یا کوئریهای سنگین دیتابیس میتواند سرور را عملاً از کار بیندازد. پروسه مقصر را پیدا و بار را کنترل میکنیم؛ اگر نشانه نفوذ یا ماینر دیده شود، آن را جداگانه بررسی میکنیم.
قطعی کمتر پیش میآید که فقط یک علت داشته باشد. بررسی را به ترتیب لایهها انجام میدهیم تا علت اصلی پیدا شود و مشکل با یک راهحل سطحی فقط برای مدتی پنهان نماند.
اولین سؤال این است که ترافیک اصلاً به سرور میرسد یا نه.
خطاهای 5xx معمولاً از همین لایه شروع میشوند.
وقتی MySQL یا MariaDB بالا نمیآید، همه سایتها همزمان از کار میافتند.
پر شدن دیسک یا رم علت پنهان بسیاری از قطعیهاست.
گاهی مشکل از خود پنل یا سرویسهای وابسته به آن است.
قطعی یک هاست مجازیسازی میتواند چند سرور را همزمان از دسترس خارج کند.
در قطعی سرور، کارهایی که در شروع ماجرا انجام میشود روی مدت قطعی و سالم ماندن داده اثر مستقیم دارد. ریاستارتهای پشتسرهم، نصب مجدد سیستمعامل یا خاموش کردن فایروال گاهی سرویس را برمیگرداند، اما سرنخ علت را پاک میکند یا مشکل تازهای میسازد. پشتیبانی فوری سرور و شبکه با ثبت وضعیت فعلی و بررسی لایهبهلایه شروع میشود. نکتههای زیر برای مدیر سایت یا سروری است که همین حالا با قطعی روبهروست یا میخواهد برای قطعی بعدی آماده باشد.
اول دامنه مشکل را روشن کنید: فقط یک سایت از دسترس خارج شده یا همه سایتهای سرور، و از یک اینترنت یا از همهجا. سایتی که از شبکه یک اپراتور باز نمیشود ولی از اپراتور دیگر باز میشود، به احتمال زیاد مشکل مسیر یا DNS دارد و خود سرور سالم است. زمان دقیق شروع قطعی و آخرین تغییر پیش از آن، مثل آپدیت، نصب افزونه یا تغییر فایروال، را هم یادداشت کنید.
بعد ببینید چه راه دسترسیای باز مانده است. کنسول VNC یا KVM پنل دیتاسنتر حتی وقتی شبکه سرور قطع است کار میکند و نشان میدهد سرور روشن است، در مرحله بوت گیر کرده یا پیام خطا میدهد. اگر سرور مجازی است و پنل اجازه میدهد، پیش از هر تغییر بزرگ snapshot بگیرید، اما اگر storage پر شده، اول مطمئن شوید snapshot فضای آن را پرتر نمیکند.
بررسی از بیرون به داخل پیش میرود. اول مطمئن شوید دامنه به IP درست resolve میشود و گواهی SSL منقضی نشده است، بعد ببینید پورتهای 80 و 443، یا 22 و 3389 برای مدیریت، از بیرون باز هستند یا نه. اگر پورت بسته است ولی سرور از کنسول در دسترس است، معمولاً فایروال، CSF یا تنظیمات کارت شبکه بعد از ریبوت مسئول است.
اگر ترافیک به سرور میرسد، سراغ سرویسها بروید. خطای 502 یعنی وبسرور از PHP-FPM یا اپلیکیشن پشت خود جوابی نگرفته و 503 اغلب یعنی سرویس پشتی از دسترس خارج شده یا سقف پروسهها پر شده است. وضعیت سرویسها را با systemctl و لاگها را با journalctl ببینید و منابع را با df -h، df -i و free بررسی کنید؛ دیسکی که پر شده یا فایلسیستمی که read-only شده، معمولاً چند سرویس را همزمان از کار میاندازد. در ویندوز سرور، Event Viewer همین نقش را دارد.
اگر سرور از کنسول سالم است و سرویسها کار میکنند اما از بیرون در دسترس نیست، مشکل ممکن است سمت دیتاسنتر یا اپراتور باشد. در این حالت رفع قطعی در اختیار ارائهدهنده است، ولی تیکتی که نتیجه traceroute از چند مسیر، زمان دقیق شروع و وضعیت سرویسهای داخل سرور را دارد، سریعتر پیگیری میشود. این شواهد را پیش از تماس با دیتاسنتر جمع کنید.
روی Proxmox یا VMware، قطعی یک میزبان میتواند چند ماشین مجازی را همزمان از دسترس خارج کند. پر شدن storage، اسنپشاتی که قفل مانده یا bridge شبکهای که بعد از تغییر تنظیمات برنگشته، از علتهای رایج روشن نشدن VMهاست. اگر نشانه نفوذ، فرایند ناشناخته پرمصرف یا فایلهای تغییرکرده دیدید، موضوع از یک قطعی ساده فراتر رفته و باید در رفع هک و مالور بررسی شود.
راهحل موقت و راهحل اصلی را از هم جدا کنید. آزاد کردن فضای دیسک سایت را برمیگرداند، اما اگر لاگچرخشی تنظیم نشود یا بکاپها روی همان دیسک بمانند، قطعی تکرار میشود. گزارش پایانی علت ریشهای، تغییرات انجامشده و کارهای پیشگیری را مینویسد؛ مثل مانیتورینگ منابع، تنظیم logrotate یا اصلاح قوانین فایروال.
اگر داده پاک شده یا دیسک آسیب دیده، کار از رفع قطعی به بازیابی اطلاعات سرور میرسد. اگر قطعیها تکرار میشوند، نگهداری مستمر در پشتیبانی و مدیریت سرور معمولاً انتخاب منطقیتری از تماس اضطراری پس از هر قطعی است. خطاهای پرتکرار cPanel و WHM را هم در راهنمای مشکلات رایج سی پنل جمع کردهایم.
مدت کار به علت قطعی بستگی دارد. یک سرویس متوقفشده یا قانون فایروال اشتباه ممکن است زود برطرف شود، اما خرابی فایلسیستم، دیتابیس آسیبدیده یا VMای که روشن نمیشود زمان بیشتری میخواهد. نوع دسترسی هم اثر دارد: با دسترسی root یا Administrator و کنسول دیتاسنتر همه لایهها بررسیپذیرند، و وقتی فقط پنل هاستینگ در دسترس است، بررسی در همان حد انجام میشود.
بررسی اولیه در تلگرام رایگان است و برآورد کار و هزینه پیش از شروع اعلام میشود. برای شروع، پیام خطا، زمان شروع قطعی، آخرین تغییر، نوع سرور و روش دسترسی موجود را بفرستید. رمز عبور را در پیام اولیه ننویسید؛ روش دسترسی موقت و محدود بعد از بررسی هماهنگ میشود.
اگر پنل دیتاسنتر گزینه Reinstall یا Rebuild دارد، تا پیش از بررسی و گرفتن نسخه پشتیبان از دادهها سراغ آن نروید، چون این گزینه همه دادههای دیسک را پاک میکند.
مشکل را در تلگرام شرح میدهید و بررسی اولیه رایگان انجام میشود. اگر کار به ورود به سرور نیاز داشت، روش دسترسی موقت و محدود را با شما هماهنگ میکنیم تا بعد از پایان کار قابل لغو باشد.
پیش از هر اقدام، وضعیت فعلی سرویسها، لاگها و منابع ثبت میشود. قطعی را لایهبهلایه بررسی میکنیم تا روشن شود مشکل از شبکه، سیستمعامل، سرویسها یا اپلیکیشن است.
سرویس با کمترین تغییر ممکن به مدار برمیگردد و هر تغییر ثبت میشود تا در صورت نیاز قابل برگشت باشد. اگر راهحل موقت لازم باشد، صریحاً میگوییم موقت است.
گزارش کوتاهی از علت ریشهای، تغییرات انجامشده و کارهایی که جلوی تکرار قطعی را میگیرد تحویل میدهید؛ مثل مانیتورینگ منابع، تنظیم لاگچرخشی یا اصلاح فایروال.
کار روزمره کانفیگ سرور، پیکربندی و نگهداری همان سرویسهایی است که هنگام قطعی از کار میافتند. به همین دلیل عیبیابی از لایهای شروع میشود که احتمال خطا در آن بیشتر است.
لینوکس و ویندوز سرور، cPanel و DirectAdmin، Proxmox و VMware، وبسرورها، دیتابیسها و فایروالها.
وضعیت پیش از تغییر و هر اقدام ثبت میشود و کار با گزارش پایانی علت ریشهای تمام میشود.
بخشی از تجربه تیم در راهنماهایی مثل مشکلات رایج سی پنل و رفع آنها در دسترس همه است.
پیش از هر هزینهای، مشکل را در تلگرام بررسی میکنیم و میگوییم مسیر رفع آن چیست.
برای خطاهای رایج سرویسها و پنل DirectAdmin پیش از تماس با کارشناس.
آموزشاینکه چطور پر شدن دیسک و رم را پیش از تبدیل شدن به قطعی ببینید.
آموزشمرجع سریع برای خطاهای پرتکرار cPanel و WHM.
یک بار ریستارت از پنل دیتاسنتر معمولاً اشکالی ندارد، اما اگر سرور بعد از آن بالا نیامد، ریبوتهای بعدی را متوقف کنید. اول از کنسول VNC یا KVM دیتاسنتر ببینید سرور در کدام مرحله گیر کرده و همان پیام را برای ما بفرستید.
در بیشتر قطعیهای سطح سرور بله، چون لاگها و سرویسها فقط با دسترسی مدیر بررسیپذیرند. توصیه میکنیم یک دسترسی موقت بسازید و بعد از پایان کار آن را حذف یا رمزش را عوض کنید. اگر فقط به پنل هاستینگ دسترسی دارید، بررسی در همان حد انجام میشود.
در این حالت رفع قطعی در اختیار ارائهدهنده است، اما با آزمایش مسیر شبکه مشخص میکنیم مشکل دقیقاً کجاست و شواهد فنی لازم برای تیکت به دیتاسنتر را آماده میکنیم تا پیگیری سریعتر پیش برود.
به علت قطعی بستگی دارد؛ یک سرویس متوقفشده ممکن است سریع برگردد، اما خرابی فایلسیستم یا دیتابیس زمان بیشتری میخواهد. بعد از بررسی اولیه رایگان، برآورد کار و هزینه را پیش از شروع اعلام میکنیم.
پشتیبانی فوری برای رفع یک اختلال مشخص است و قرارداد مدیریت سرور کار مستمر: پایش، آپدیت، بکاپ و رسیدگی پیش از آنکه مشکل به قطعی برسد. اگر قطعیها تکرار میشوند، مدیریت مستمر معمولاً انتخاب منطقیتری است.
پیام خطا، زمان شروع قطعی و آخرین تغییر را در تلگرام بفرستید تا بررسی اولیه رایگان انجام شود و مسیر رفع مشکل را بدانید.