موتور جستجو چطور کار میکند؟
سه مرحلهای که هر صفحه باید طی کند تا در نتایج دیده شود؛ خزش (Crawling)، ایندکس (Indexing) و بازیابی و رتبهبندی (Retrieving) — بههمراه نقش robots.txt و sitemap.
در این فصل یاد میگیرید
- سه مرحله Crawling، Indexing و Retrieving را توضیح دهید
- تفاوت «خزیده شدن» و «ایندکس شدن» را بدانید
- کارکرد robots.txt و sitemap.xml را بشناسید
- بفهمید صفحه یتیم چیست و چرا هرگز دیده نمیشود
سه مرحلهای که هر صفحه باید طی کند
قبل از اینکه صفحهای در نتایج گوگل دیده شود، باید از سه فیلتر عبور کند. اگر در هر مرحله متوقف شود، مراحل بعد اصلاً اتفاق نمیافتد:
- Crawling — خزش: ربات گوگل صفحه را پیدا و محتوایش را دانلود میکند.
- Indexing — ایندکس: گوگل محتوا را میفهمد و در پایگاه داده عظیمش ذخیره میکند.
- Retrieving & Ranking — بازیابی و رتبهبندی: وقتی کسی جستجو میکند، گوگل از ایندکس مرتبطترین صفحات را بیرون میکشد و مرتب میکند.
این سه مرحله را میتوانید در شبیهساز موتور جستجو بهصورت عملی ببینید. توصیه میکنم بعد از خواندن این فصل حتماً چند دقیقه با آن کار کنید.
مرحله ۱: خزش (Crawling)
ربات گوگل که به آن Googlebot میگویند، مثل یک کاربر بسیار سریع در وب میچرخد. اما یک محدودیت اساسی دارد:
گوگلبات فقط از راه لینک یا sitemap میتواند صفحهای را پیدا کند. اگر صفحهای در هیچکدام نباشد، برای گوگل اصلاً وجود ندارد — حتی اگر عالیترین محتوای دنیا را داشته باشد.
صفحه یتیم (Orphan Page)
صفحهای که هیچ لینک داخلی به آن داده نشده و در sitemap هم نیامده، صفحه یتیم است. این یکی از رایجترین اشتباهات در سایتهای بزرگ است:
یک مقاله عالی مینویسید، منتشر میکنید، ولی از هیچ صفحهای به آن لینک نمیدهید و در هیچ دستهبندی هم قرار نمیگیرد. بعد از سه ماه تعجب میکنید که چرا هیچ بازدیدی ندارد.
هر مقالهای که منتشر میکنید باید حداقل از یک جای دیگر سایت لینک بگیرد: صفحه دستهبندی، صفحه اصلی، یا مقالات مرتبط قدیمیتر. عادت کنید بعد از انتشار هر مقاله، دو یا سه مقاله قدیمی مرتبط را باز کنید و از داخل متن آنها به مقاله جدید لینک بدهید.
robots.txt
فایلی در ریشه سایت که به خزندهها میگوید کجا نروند:
User-agent: *
Disallow: /admin/
Disallow: /cart/
Sitemap: https://example.com/sitemap.xml
یک سوءتفاهم بسیار رایج: robots.txt صفحه را از گوگل حذف نمیکند. فقط جلوی خزش را میگیرد. اگر صفحهای از جای دیگری لینک گرفته باشد، ممکن است بدون توضیحات در نتایج ظاهر شود.
بدتر اینکه اگر صفحهای را هم در robots ببندید و هم تگ noindex رویش بگذارید، گوگل چون اجازه خزش ندارد اصلاً آن تگ noindex را نمیبیند. برای حذف قطعی، صفحه را در robots باز بگذارید و noindex بزنید.
بودجه خزش (Crawl Budget)
گوگل برای هر سایت تعداد محدودی صفحه در هر بازه میخزد. برای سایت کوچک اهمیتی ندارد، ولی برای سایت بزرگ مثل سایت ما مهم است:
- صفحات تکراری، فیلترهای بیپایان فروشگاهی و صفحات بیارزش، بودجه خزش را هدر میدهند.
- نتیجه: مقاله جدید شما بهجای اینکه فردا خزیده شود، دو هفته بعد خزیده میشود.
مرحله ۲: ایندکس (Indexing)
خزیده شدن تضمینی برای ایندکس شدن نیست. این تفاوت را بسیاری از افراد نمیدانند و همین باعث سردرگمی میشود.
بعد از خزش، گوگل محتوا را تحلیل میکند: موضوع صفحه چیست؟ چه کلماتی مهماند؟ آیا این محتوا ارزش ذخیره کردن دارد؟ صفحه در این مرحله ممکن است رد شود:
| دلیل رد شدن | توضیح |
|---|---|
| تگ noindex | خودمان صریحاً گفتهایم ایندکس نشود |
| محتوای بسیار کم (Thin Content) | صفحهای با دو خط متن ارزش ذخیره ندارد |
| محتوای تکراری | نسخهی دیگری از همین محتوا از قبل در ایندکس هست |
| کیفیت پایین | محتوای بیارزش یا خودکار تولیدشده |
گذاشتن تگ noindex روی یک صفحه هنگام طراحی یا بازطراحی سایت و فراموش کردن برداشتن آن پس از انتشار. این اتفاق آنقدر رایج است که یکی از اولین چیزهایی است که هنگام افت ناگهانی ترافیک باید بررسی شود.
رندر شدن (Rendering)
اگر محتوای صفحه با جاوااسکریپت ساخته شود، گوگل باید صفحه را مثل مرورگر اجرا کند تا محتوا را ببیند. این مرحله منابع زیادی میخواهد و ممکن است با تأخیر انجام شود.
هر محتوای مهمی که میخواهید ایندکس شود، بهتر است در همان HTML اولیه صفحه موجود باشد، نه اینکه بعداً با جاوااسکریپت بارگذاری شود.
مرحله ۳: بازیابی و رتبهبندی (Retrieving)
وقتی کاربر عبارتی را جستجو میکند، گوگل در کسری از ثانیه:
- نیت کاربر را میفهمد — آیا دنبال خرید است یا آموزش؟ (فصل بعد کامل توضیح میدهیم)
- صفحات مرتبط را از ایندکس بیرون میکشد — نه از کل اینترنت، فقط از ایندکس خودش.
- آنها را با صدها سیگنال امتیازدهی میکند — کیفیت محتوا، لینکها، سرعت، تجربه کاربری، تازگی محتوا و…
- نتیجه را مرتب و نمایش میدهد.
نکته کلیدی: گوگل در لحظه جستجو، اینترنت را نمیگردد. گوگل فقط ایندکس خودش را میگردد. به همین دلیل است که اگر صفحه شما ایندکس نشده باشد، هر کاری هم بکنید در نتایج نمیآید. اول ایندکس، بعد رتبه.
کارهایی که شما باید انجام دهید
۱. بعد از انتشار هر مقاله، حداقل دو لینک داخلی از صفحات قدیمی به آن بدهید.
۲. در گوگل سرچ کنسول با ابزار URL Inspection آدرس مقاله جدید را بررسی و درخواست ایندکس بدهید.
۳. هر از چند وقت با جستجوی site:example.com در گوگل ببینید چند صفحه از سایت ایندکس شده است.
۴. اگر صفحهای نباید در نتایج باشد (مثل صفحه سبد خرید یا نتایج جستجوی داخلی)، به تیم فنی بگویید نه اینکه خودتان robots.txt را دستکاری کنید.
هرگز فایل robots.txt سایت را بدون هماهنگی با مسئول سئو تغییر ندهید. یک خط اشتباه در این فایل میتواند کل سایت را از نتایج گوگل خارج کند. مشهورترین فاجعه سئو، خط Disallow: / است که یعنی «هیچ صفحهای از این سایت را نخز».
جمعبندی
- ترتیب همیشه این است: خزش ← ایندکس ← رتبهبندی. توقف در هر مرحله یعنی پایان کار.
- گوگل صفحه را فقط از راه لینک یا sitemap پیدا میکند؛ صفحه بدون لینک، صفحه یتیم است.
- robots.txt جلوی خزش را میگیرد؛ noindex جلوی ایندکس را. این دو یکی نیستند.
- خزیده شدن به معنی ایندکس شدن نیست، و ایندکس شدن به معنی رتبه گرفتن نیست.
- محتوای مهم باید در HTML اولیه باشد، نه فقط با جاوااسکریپت.
در فصل بعد سراغ مهمترین سؤال میرویم: کاربری که جستجو میکند دقیقاً چه میخواهد، و ما در کدام مرحله از سفر او هستیم.
آزمون این فصل
۶ سؤال چهارگزینهای. نمره قبولی ۷۰٪ است و میتوانید آزمون را دوباره بدهید.
شروع آزمون