موتور جستجو چطور کار می‌کند؟

سه مرحله‌ای که هر صفحه باید طی کند تا در نتایج دیده شود؛ خزش (Crawling)، ایندکس (Indexing) و بازیابی و رتبه‌بندی (Retrieving) — به‌همراه نقش robots.txt و sitemap.

⏱ حدود ۲۲ دقیقه مطالعه

در این فصل یاد می‌گیرید

  • سه مرحله Crawling، Indexing و Retrieving را توضیح دهید
  • تفاوت «خزیده شدن» و «ایندکس شدن» را بدانید
  • کارکرد robots.txt و sitemap.xml را بشناسید
  • بفهمید صفحه یتیم چیست و چرا هرگز دیده نمی‌شود

سه مرحله‌ای که هر صفحه باید طی کند

قبل از اینکه صفحه‌ای در نتایج گوگل دیده شود، باید از سه فیلتر عبور کند. اگر در هر مرحله متوقف شود، مراحل بعد اصلاً اتفاق نمی‌افتد:

  1. Crawling — خزش: ربات گوگل صفحه را پیدا و محتوایش را دانلود می‌کند.
  2. Indexing — ایندکس: گوگل محتوا را می‌فهمد و در پایگاه داده عظیمش ذخیره می‌کند.
  3. Retrieving & Ranking — بازیابی و رتبه‌بندی: وقتی کسی جستجو می‌کند، گوگل از ایندکس مرتبط‌ترین صفحات را بیرون می‌کشد و مرتب می‌کند.
نکته

این سه مرحله را می‌توانید در شبیه‌ساز موتور جستجو به‌صورت عملی ببینید. توصیه می‌کنم بعد از خواندن این فصل حتماً چند دقیقه با آن کار کنید.

مرحله ۱: خزش (Crawling)

ربات گوگل که به آن Googlebot می‌گویند، مثل یک کاربر بسیار سریع در وب می‌چرخد. اما یک محدودیت اساسی دارد:

هشدار

گوگل‌بات فقط از راه لینک یا sitemap می‌تواند صفحه‌ای را پیدا کند. اگر صفحه‌ای در هیچ‌کدام نباشد، برای گوگل اصلاً وجود ندارد — حتی اگر عالی‌ترین محتوای دنیا را داشته باشد.

صفحه یتیم (Orphan Page)

صفحه‌ای که هیچ لینک داخلی به آن داده نشده و در sitemap هم نیامده، صفحه یتیم است. این یکی از رایج‌ترین اشتباهات در سایت‌های بزرگ است:

اشتباه رایج

یک مقاله عالی می‌نویسید، منتشر می‌کنید، ولی از هیچ صفحه‌ای به آن لینک نمی‌دهید و در هیچ دسته‌بندی هم قرار نمی‌گیرد. بعد از سه ماه تعجب می‌کنید که چرا هیچ بازدیدی ندارد.

روش درست

هر مقاله‌ای که منتشر می‌کنید باید حداقل از یک جای دیگر سایت لینک بگیرد: صفحه دسته‌بندی، صفحه اصلی، یا مقالات مرتبط قدیمی‌تر. عادت کنید بعد از انتشار هر مقاله، دو یا سه مقاله قدیمی مرتبط را باز کنید و از داخل متن آن‌ها به مقاله جدید لینک بدهید.

robots.txt

فایلی در ریشه سایت که به خزنده‌ها می‌گوید کجا نروند:

User-agent: *
Disallow: /admin/
Disallow: /cart/
Sitemap: https://example.com/sitemap.xml
هشدار

یک سوءتفاهم بسیار رایج: robots.txt صفحه را از گوگل حذف نمی‌کند. فقط جلوی خزش را می‌گیرد. اگر صفحه‌ای از جای دیگری لینک گرفته باشد، ممکن است بدون توضیحات در نتایج ظاهر شود.

بدتر اینکه اگر صفحه‌ای را هم در robots ببندید و هم تگ noindex رویش بگذارید، گوگل چون اجازه خزش ندارد اصلاً آن تگ noindex را نمی‌بیند. برای حذف قطعی، صفحه را در robots باز بگذارید و noindex بزنید.

بودجه خزش (Crawl Budget)

گوگل برای هر سایت تعداد محدودی صفحه در هر بازه می‌خزد. برای سایت کوچک اهمیتی ندارد، ولی برای سایت بزرگ مثل سایت ما مهم است:

  • صفحات تکراری، فیلترهای بی‌پایان فروشگاهی و صفحات بی‌ارزش، بودجه خزش را هدر می‌دهند.
  • نتیجه: مقاله جدید شما به‌جای اینکه فردا خزیده شود، دو هفته بعد خزیده می‌شود.

مرحله ۲: ایندکس (Indexing)

خزیده شدن تضمینی برای ایندکس شدن نیست. این تفاوت را بسیاری از افراد نمی‌دانند و همین باعث سردرگمی می‌شود.

بعد از خزش، گوگل محتوا را تحلیل می‌کند: موضوع صفحه چیست؟ چه کلماتی مهم‌اند؟ آیا این محتوا ارزش ذخیره کردن دارد؟ صفحه در این مرحله ممکن است رد شود:

دلیل رد شدنتوضیح
تگ noindexخودمان صریحاً گفته‌ایم ایندکس نشود
محتوای بسیار کم (Thin Content)صفحه‌ای با دو خط متن ارزش ذخیره ندارد
محتوای تکرارینسخه‌ی دیگری از همین محتوا از قبل در ایندکس هست
کیفیت پایینمحتوای بی‌ارزش یا خودکار تولیدشده
اشتباه رایج

گذاشتن تگ noindex روی یک صفحه هنگام طراحی یا بازطراحی سایت و فراموش کردن برداشتن آن پس از انتشار. این اتفاق آن‌قدر رایج است که یکی از اولین چیزهایی است که هنگام افت ناگهانی ترافیک باید بررسی شود.

رندر شدن (Rendering)

اگر محتوای صفحه با جاوااسکریپت ساخته شود، گوگل باید صفحه را مثل مرورگر اجرا کند تا محتوا را ببیند. این مرحله منابع زیادی می‌خواهد و ممکن است با تأخیر انجام شود.

روش درست

هر محتوای مهمی که می‌خواهید ایندکس شود، بهتر است در همان HTML اولیه صفحه موجود باشد، نه اینکه بعداً با جاوااسکریپت بارگذاری شود.

مرحله ۳: بازیابی و رتبه‌بندی (Retrieving)

وقتی کاربر عبارتی را جستجو می‌کند، گوگل در کسری از ثانیه:

  1. نیت کاربر را می‌فهمد — آیا دنبال خرید است یا آموزش؟ (فصل بعد کامل توضیح می‌دهیم)
  2. صفحات مرتبط را از ایندکس بیرون می‌کشد — نه از کل اینترنت، فقط از ایندکس خودش.
  3. آن‌ها را با صدها سیگنال امتیازدهی می‌کند — کیفیت محتوا، لینک‌ها، سرعت، تجربه کاربری، تازگی محتوا و…
  4. نتیجه را مرتب و نمایش می‌دهد.
نکته

نکته کلیدی: گوگل در لحظه جستجو، اینترنت را نمی‌گردد. گوگل فقط ایندکس خودش را می‌گردد. به همین دلیل است که اگر صفحه شما ایندکس نشده باشد، هر کاری هم بکنید در نتایج نمی‌آید. اول ایندکس، بعد رتبه.

کارهایی که شما باید انجام دهید

روش درست

۱. بعد از انتشار هر مقاله، حداقل دو لینک داخلی از صفحات قدیمی به آن بدهید.

۲. در گوگل سرچ کنسول با ابزار URL Inspection آدرس مقاله جدید را بررسی و درخواست ایندکس بدهید.

۳. هر از چند وقت با جستجوی site:example.com در گوگل ببینید چند صفحه از سایت ایندکس شده است.

۴. اگر صفحه‌ای نباید در نتایج باشد (مثل صفحه سبد خرید یا نتایج جستجوی داخلی)، به تیم فنی بگویید نه اینکه خودتان robots.txt را دستکاری کنید.

هشدار

هرگز فایل robots.txt سایت را بدون هماهنگی با مسئول سئو تغییر ندهید. یک خط اشتباه در این فایل می‌تواند کل سایت را از نتایج گوگل خارج کند. مشهورترین فاجعه سئو، خط Disallow: / است که یعنی «هیچ صفحه‌ای از این سایت را نخز».

جمع‌بندی

  • ترتیب همیشه این است: خزش ← ایندکس ← رتبه‌بندی. توقف در هر مرحله یعنی پایان کار.
  • گوگل صفحه را فقط از راه لینک یا sitemap پیدا می‌کند؛ صفحه بدون لینک، صفحه یتیم است.
  • robots.txt جلوی خزش را می‌گیرد؛ noindex جلوی ایندکس را. این دو یکی نیستند.
  • خزیده شدن به معنی ایندکس شدن نیست، و ایندکس شدن به معنی رتبه گرفتن نیست.
  • محتوای مهم باید در HTML اولیه باشد، نه فقط با جاوااسکریپت.

در فصل بعد سراغ مهم‌ترین سؤال می‌رویم: کاربری که جستجو می‌کند دقیقاً چه می‌خواهد، و ما در کدام مرحله از سفر او هستیم.

آزمون این فصل

۶ سؤال چهارگزینه‌ای. نمره قبولی ۷۰٪ است و می‌توانید آزمون را دوباره بدهید.

شروع آزمون