پاسخ اضطراری ۲۴/۷

پشتیبانی فوری سرور و شبکه ۲۴/۷ برای رفع قطعی و اختلال

پشتیبانی فوری سرور و شبکه برای وقتی است که سایت از دسترس خارج شده، SSH یا ریموت دسکتاپ وصل نمی‌شود یا سرویس‌ها پشت‌سرهم از کار می‌افتند. تیم کانفیگ سرور علت قطعی را از لایه شبکه تا سرویس‌ها و لاگ‌ها ردیابی می‌کند، سرویس را با کمترین تغییر به مدار برمی‌گرداند و علت ریشه‌ای را مکتوب تحویل می‌دهد.

Linux و Windows Server cPanel و DirectAdmin Proxmox و VMware بررسی اولیه رایگان در تلگرام

تا رسیدن کارشناس این کارها را انجام ندهید

  1. ریستارت پشت‌سرهم سرور. هر ریبوت ممکن است لاگ‌های موقت و وضعیت پروسه‌ها را پاک کند، و اگر دیسک یا فایل‌سیستم مشکل داشته باشد، سرور ممکن است دیگر بالا نیاید.
  2. نصب مجدد سیستم‌عامل از پنل دیتاسنتر. گزینه Reinstall یا Rebuild همه داده‌های دیسک را پاک می‌کند. قطعی را می‌شود رفع کرد، اما داده ازدست‌رفته را همیشه نمی‌شود برگرداند.
  3. غیرفعال کردن کامل فایروال برای «امتحان». ممکن است سایت برگردد، اما سرور بی‌دفاع به اینترنت وصل می‌ماند. تغییرات فایروال را یادداشت کنید و یکی‌یکی انجام دهید.
  4. پاک کردن لاگ‌ها برای آزاد کردن فضا. اگر دیسک پر شده، لاگ‌ها اغلب تنها سرنخ علت قطعی‌اند. پیش از حذف، دست‌کم آخرین بخش آن‌ها را جای دیگری کپی کنید.
  5. اجرای دستورهای ناشناخته از انجمن‌ها. دستوری که روی یک سرور جواب داده، روی توزیع یا کنترل‌پنل دیگر ممکن است سرویس‌های سالم را هم از کار بیندازد.

این اطلاعات را آماده کنید

  • زمان دقیق شروع قطعی و آخرین تغییری که قبل از آن انجام شده (آپدیت، نصب افزونه، تغییر DNS یا فایروال)
  • پیام خطای دقیق یا اسکرین‌شات آن، مثل 502 Bad Gateway، Connection timed out یا خطای اتصال دیتابیس
  • نوع سرور و سیستم‌عامل، کنترل‌پنل، نام دیتاسنتر و اینکه کدام سرویس‌ها از دسترس خارج شده‌اند
  • روش دسترسی موجود: کنسول VNC/KVM دیتاسنتر، SSH، RDP یا فقط پنل هاستینگ
چه زمانی به این خدمت نیاز دارید؟

نشانه‌های قطعی که بررسی فوری سرور را لازم می‌کنند

سایت باز نمی‌شود یا خطای 502 و 503 می‌دهد

معمولاً یعنی وب‌سرور، PHP-FPM یا دیتابیس پاسخ نمی‌دهد، منابع سرور تمام شده یا گواهی SSL و DNS به‌هم خورده است. زنجیره درخواست را از DNS تا اپلیکیشن دنبال می‌کنیم تا نقطه قطع مشخص شود.

SSH، RDP یا پنل مدیریت وصل نمی‌شود

قفل شدن پشت فایروال یا CSF، تغییر پورت، پر شدن دیسک یا مشکل تنظیمات شبکه بعد از ریبوت از رایج‌ترین علت‌هاست. از کنسول دیتاسنتر وارد می‌شویم و دسترسی را بدون پاک کردن تنظیمات امنیتی برمی‌گردانیم.

سرور به‌شدت کند است و سرویس‌ها پشت‌سرهم کرش می‌کنند

مصرف کامل CPU یا رم، فعال شدن OOM Killer، پر شدن inode یا کوئری‌های سنگین دیتابیس می‌تواند سرور را عملاً از کار بیندازد. پروسه مقصر را پیدا و بار را کنترل می‌کنیم؛ اگر نشانه نفوذ یا ماینر دیده شود، آن را جداگانه بررسی می‌کنیم.

رفع قطعی سرور

در پشتیبانی فوری چه لایه‌هایی را بررسی و رفع می‌کنیم؟

قطعی کمتر پیش می‌آید که فقط یک علت داشته باشد. بررسی را به ترتیب لایه‌ها انجام می‌دهیم تا علت اصلی پیدا شود و مشکل با یک راه‌حل سطحی فقط برای مدتی پنهان نماند.

شبکه، DNS و دسترسی

اولین سؤال این است که ترافیک اصلاً به سرور می‌رسد یا نه.

  • بررسی رکوردهای DNS و مسیر ترافیک
  • رفع قفل شدن پشت iptables، CSF یا فایروال ویندوز
  • بازگرداندن تنظیمات کارت شبکه و مسیریابی

وب‌سرور و PHP

خطاهای 5xx معمولاً از همین لایه شروع می‌شوند.

  • عیب‌یابی Nginx، Apache و LiteSpeed و بررسی PHP-FPM، محدودیت پروسه‌ها و timeoutها
  • رفع خطای گواهی SSL و پیکربندی virtual host

دیتابیس

وقتی MySQL یا MariaDB بالا نمی‌آید، همه سایت‌ها هم‌زمان از کار می‌افتند.

  • تحلیل error log و علت توقف سرویس
  • بررسی جدول‌های آسیب‌دیده پیش از هر تعمیر
  • شناسایی کوئری‌ها و اتصال‌های قفل‌کننده

منابع، دیسک و سیستم‌عامل

پر شدن دیسک یا رم علت پنهان بسیاری از قطعی‌هاست.

  • آزادسازی امن فضا و inode بدون حذف داده مهم
  • بررسی فایل‌سیستم read-only و خطاهای دیسک
  • تحلیل systemd و journal در لینوکس
  • تحلیل Event Viewer در ویندوز سرور

کنترل‌پنل هاستینگ

گاهی مشکل از خود پنل یا سرویس‌های وابسته به آن است.

  • بازگرداندن سرویس‌های cPanel/WHM و DirectAdmin
  • رفع خطای ایمیل، FTP و سرویس‌های پنل
  • بررسی خطاهای بعد از آپدیت پنل

ماشین‌های مجازی و میزبان

قطعی یک هاست مجازی‌سازی می‌تواند چند سرور را هم‌زمان از دسترس خارج کند.

  • بررسی VMهایی که روی Proxmox یا VMware روشن نمی‌شوند
  • رفع پر شدن storage و قفل ماندن اسنپ‌شات
  • بازگرداندن شبکه مجازی و bridgeها
راهنمای کامل

راهنمای پشتیبانی فوری سرور و شبکه: از اولین نشانه تا علت ریشه‌ای

در قطعی سرور، کارهایی که در شروع ماجرا انجام می‌شود روی مدت قطعی و سالم ماندن داده اثر مستقیم دارد. ری‌استارت‌های پشت‌سرهم، نصب مجدد سیستم‌عامل یا خاموش کردن فایروال گاهی سرویس را برمی‌گرداند، اما سرنخ علت را پاک می‌کند یا مشکل تازه‌ای می‌سازد. پشتیبانی فوری سرور و شبکه با ثبت وضعیت فعلی و بررسی لایه‌به‌لایه شروع می‌شود. نکته‌های زیر برای مدیر سایت یا سروری است که همین حالا با قطعی روبه‌روست یا می‌خواهد برای قطعی بعدی آماده باشد.

در شروع قطعی چه چیزهایی را مشخص کنید؟

اول دامنه مشکل را روشن کنید: فقط یک سایت از دسترس خارج شده یا همه سایت‌های سرور، و از یک اینترنت یا از همه‌جا. سایتی که از شبکه یک اپراتور باز نمی‌شود ولی از اپراتور دیگر باز می‌شود، به احتمال زیاد مشکل مسیر یا DNS دارد و خود سرور سالم است. زمان دقیق شروع قطعی و آخرین تغییر پیش از آن، مثل آپدیت، نصب افزونه یا تغییر فایروال، را هم یادداشت کنید.

بعد ببینید چه راه دسترسی‌ای باز مانده است. کنسول VNC یا KVM پنل دیتاسنتر حتی وقتی شبکه سرور قطع است کار می‌کند و نشان می‌دهد سرور روشن است، در مرحله بوت گیر کرده یا پیام خطا می‌دهد. اگر سرور مجازی است و پنل اجازه می‌دهد، پیش از هر تغییر بزرگ snapshot بگیرید، اما اگر storage پر شده، اول مطمئن شوید snapshot فضای آن را پرتر نمی‌کند.

عیب‌یابی لایه‌به‌لایه: DNS، شبکه، سرویس‌ها و منابع

بررسی از بیرون به داخل پیش می‌رود. اول مطمئن شوید دامنه به IP درست resolve می‌شود و گواهی SSL منقضی نشده است، بعد ببینید پورت‌های 80 و 443، یا 22 و 3389 برای مدیریت، از بیرون باز هستند یا نه. اگر پورت بسته است ولی سرور از کنسول در دسترس است، معمولاً فایروال، CSF یا تنظیمات کارت شبکه بعد از ریبوت مسئول است.

اگر ترافیک به سرور می‌رسد، سراغ سرویس‌ها بروید. خطای 502 یعنی وب‌سرور از PHP-FPM یا اپلیکیشن پشت خود جوابی نگرفته و 503 اغلب یعنی سرویس پشتی از دسترس خارج شده یا سقف پروسه‌ها پر شده است. وضعیت سرویس‌ها را با systemctl و لاگ‌ها را با journalctl ببینید و منابع را با df -h، df -i و free بررسی کنید؛ دیسکی که پر شده یا فایل‌سیستمی که read-only شده، معمولاً چند سرویس را هم‌زمان از کار می‌اندازد. در ویندوز سرور، Event Viewer همین نقش را دارد.

وقتی مشکل از دیتاسنتر، اپراتور یا مجازی‌ساز است

اگر سرور از کنسول سالم است و سرویس‌ها کار می‌کنند اما از بیرون در دسترس نیست، مشکل ممکن است سمت دیتاسنتر یا اپراتور باشد. در این حالت رفع قطعی در اختیار ارائه‌دهنده است، ولی تیکتی که نتیجه traceroute از چند مسیر، زمان دقیق شروع و وضعیت سرویس‌های داخل سرور را دارد، سریع‌تر پیگیری می‌شود. این شواهد را پیش از تماس با دیتاسنتر جمع کنید.

روی Proxmox یا VMware، قطعی یک میزبان می‌تواند چند ماشین مجازی را هم‌زمان از دسترس خارج کند. پر شدن storage، اسنپ‌شاتی که قفل مانده یا bridge شبکه‌ای که بعد از تغییر تنظیمات برنگشته، از علت‌های رایج روشن نشدن VMهاست. اگر نشانه نفوذ، فرایند ناشناخته پرمصرف یا فایل‌های تغییرکرده دیدید، موضوع از یک قطعی ساده فراتر رفته و باید در رفع هک و مالور بررسی شود.

بعد از برگشتن سرویس: گزارش علت و جلوگیری از تکرار

راه‌حل موقت و راه‌حل اصلی را از هم جدا کنید. آزاد کردن فضای دیسک سایت را برمی‌گرداند، اما اگر لاگ‌چرخشی تنظیم نشود یا بکاپ‌ها روی همان دیسک بمانند، قطعی تکرار می‌شود. گزارش پایانی علت ریشه‌ای، تغییرات انجام‌شده و کارهای پیشگیری را می‌نویسد؛ مثل مانیتورینگ منابع، تنظیم logrotate یا اصلاح قوانین فایروال.

اگر داده پاک شده یا دیسک آسیب دیده، کار از رفع قطعی به بازیابی اطلاعات سرور می‌رسد. اگر قطعی‌ها تکرار می‌شوند، نگهداری مستمر در پشتیبانی و مدیریت سرور معمولاً انتخاب منطقی‌تری از تماس اضطراری پس از هر قطعی است. خطاهای پرتکرار cPanel و WHM را هم در راهنمای مشکلات رایج سی پنل جمع کرده‌ایم.

زمان و هزینه رفع قطعی به چه بستگی دارد؟

مدت کار به علت قطعی بستگی دارد. یک سرویس متوقف‌شده یا قانون فایروال اشتباه ممکن است زود برطرف شود، اما خرابی فایل‌سیستم، دیتابیس آسیب‌دیده یا VMای که روشن نمی‌شود زمان بیشتری می‌خواهد. نوع دسترسی هم اثر دارد: با دسترسی root یا Administrator و کنسول دیتاسنتر همه لایه‌ها بررسی‌پذیرند، و وقتی فقط پنل هاستینگ در دسترس است، بررسی در همان حد انجام می‌شود.

بررسی اولیه در تلگرام رایگان است و برآورد کار و هزینه پیش از شروع اعلام می‌شود. برای شروع، پیام خطا، زمان شروع قطعی، آخرین تغییر، نوع سرور و روش دسترسی موجود را بفرستید. رمز عبور را در پیام اولیه ننویسید؛ روش دسترسی موقت و محدود بعد از بررسی هماهنگ می‌شود.

اگر پنل دیتاسنتر گزینه Reinstall یا Rebuild دارد، تا پیش از بررسی و گرفتن نسخه پشتیبان از داده‌ها سراغ آن نروید، چون این گزینه همه داده‌های دیسک را پاک می‌کند.

فرآیند اجرای کار

از گزارش مشکل تا گزارش علت ریشه‌ای در چهار گام

۱. شرح مشکل و دسترسی امن

مشکل را در تلگرام شرح می‌دهید و بررسی اولیه رایگان انجام می‌شود. اگر کار به ورود به سرور نیاز داشت، روش دسترسی موقت و محدود را با شما هماهنگ می‌کنیم تا بعد از پایان کار قابل لغو باشد.

۲. تشخیص پیش از تغییر

پیش از هر اقدام، وضعیت فعلی سرویس‌ها، لاگ‌ها و منابع ثبت می‌شود. قطعی را لایه‌به‌لایه بررسی می‌کنیم تا روشن شود مشکل از شبکه، سیستم‌عامل، سرویس‌ها یا اپلیکیشن است.

۳. بازگرداندن سرویس

سرویس با کمترین تغییر ممکن به مدار برمی‌گردد و هر تغییر ثبت می‌شود تا در صورت نیاز قابل برگشت باشد. اگر راه‌حل موقت لازم باشد، صریحاً می‌گوییم موقت است.

۴. گزارش و پیشگیری

گزارش کوتاهی از علت ریشه‌ای، تغییرات انجام‌شده و کارهایی که جلوی تکرار قطعی را می‌گیرد تحویل می‌دهید؛ مثل مانیتورینگ منابع، تنظیم لاگ‌چرخشی یا اصلاح فایروال.

محدوده پشتیبانی فوری سرور و شبکه

شامل این خدمت

  • عیب‌یابی از راه دور سرورهای لینوکس و ویندوز، سرور مجازی و اختصاصی
  • رفع اختلال وب‌سرور، PHP، دیتابیس، ایمیل و سرویس‌های کنترل‌پنل
  • رفع قفل شدن دسترسی و اشکالات تنظیمات فایروال و شبکه سرور
  • بررسی میزبان‌ها و ماشین‌های مجازی Proxmox و VMware
  • گزارش مکتوب علت قطعی و پیشنهادهای پیشگیری

خارج از این خدمت

  • قطعی سمت دیتاسنتر یا اپراتور اینترنت؛ در این حالت شواهد فنی را برای پیگیری با ارائه‌دهنده آماده می‌کنیم
  • تعمیر یا تعویض حضوری سخت‌افزار
  • سرور یا سایت هک‌شده؛ این مورد در رفع هک و مالور بررسی می‌شود
  • داده پاک‌شده یا دیسک خراب؛ به بازیابی اطلاعات سرور مراجعه کنید و اگر فایل‌ها رمز شده‌اند به بازیابی از باج‌افزار
  • نگهداری و پایش مستمر؛ برای جلوگیری از قطعی‌های بعدی پشتیبانی و مدیریت سرور مناسب‌تر است
چرا کانفیگ سرور؟

همان تیمی که سرور را کانفیگ می‌کند، قطعی را هم عیب‌یابی می‌کند

کار روزمره کانفیگ سرور، پیکربندی و نگهداری همان سرویس‌هایی است که هنگام قطعی از کار می‌افتند. به همین دلیل عیب‌یابی از لایه‌ای شروع می‌شود که احتمال خطا در آن بیشتر است.

01

پوشش فناوری‌های رایج سرور

لینوکس و ویندوز سرور، cPanel و DirectAdmin، Proxmox و VMware، وب‌سرورها، دیتابیس‌ها و فایروال‌ها.

02

فرآیند مستند و قابل برگشت

وضعیت پیش از تغییر و هر اقدام ثبت می‌شود و کار با گزارش پایانی علت ریشه‌ای تمام می‌شود.

03

راهنماهای فنی منتشرشده

بخشی از تجربه تیم در راهنماهایی مثل مشکلات رایج سی پنل و رفع آن‌ها در دسترس همه است.

04

بررسی اولیه رایگان

پیش از هر هزینه‌ای، مشکل را در تلگرام بررسی می‌کنیم و می‌گوییم مسیر رفع آن چیست.

سوالات متداول

پرسش‌های رایج درباره رفع قطعی سرور

سرور از دسترس خارج شده؛ ریستارت کنم یا نه؟

یک بار ریستارت از پنل دیتاسنتر معمولاً اشکالی ندارد، اما اگر سرور بعد از آن بالا نیامد، ریبوت‌های بعدی را متوقف کنید. اول از کنسول VNC یا KVM دیتاسنتر ببینید سرور در کدام مرحله گیر کرده و همان پیام را برای ما بفرستید.

برای رفع قطعی به دسترسی root یا Administrator نیاز دارید؟

در بیشتر قطعی‌های سطح سرور بله، چون لاگ‌ها و سرویس‌ها فقط با دسترسی مدیر بررسی‌پذیرند. توصیه می‌کنیم یک دسترسی موقت بسازید و بعد از پایان کار آن را حذف یا رمزش را عوض کنید. اگر فقط به پنل هاستینگ دسترسی دارید، بررسی در همان حد انجام می‌شود.

اگر مشکل از دیتاسنتر یا اینترنت باشد چه می‌شود؟

در این حالت رفع قطعی در اختیار ارائه‌دهنده است، اما با آزمایش مسیر شبکه مشخص می‌کنیم مشکل دقیقاً کجاست و شواهد فنی لازم برای تیکت به دیتاسنتر را آماده می‌کنیم تا پیگیری سریع‌تر پیش برود.

رفع قطعی چقدر طول می‌کشد و هزینه آن چطور مشخص می‌شود؟

به علت قطعی بستگی دارد؛ یک سرویس متوقف‌شده ممکن است سریع برگردد، اما خرابی فایل‌سیستم یا دیتابیس زمان بیشتری می‌خواهد. بعد از بررسی اولیه رایگان، برآورد کار و هزینه را پیش از شروع اعلام می‌کنیم.

تفاوت پشتیبانی فوری با قرارداد مدیریت سرور چیست؟

پشتیبانی فوری برای رفع یک اختلال مشخص است و قرارداد مدیریت سرور کار مستمر: پایش، آپدیت، بکاپ و رسیدگی پیش از آنکه مشکل به قطعی برسد. اگر قطعی‌ها تکرار می‌شوند، مدیریت مستمر معمولاً انتخاب منطقی‌تری است.

سرور یا شبکه همین حالا از دسترس خارج است؟

پیام خطا، زمان شروع قطعی و آخرین تغییر را در تلگرام بفرستید تا بررسی اولیه رایگان انجام شود و مسیر رفع مشکل را بدانید.