SEO التقني
١٣ أغسطس ٢٠٢٦ 10 دقائق

دليل robots.txt وSitemap.xml: الإعداد الصحيح والأخطاء الشائعة

دليل robots.txt وSitemap.xml: الإعداد الصحيح والأخطاء الشائعة

تلخيص بالذكاء الاصطناعي

دع الذكاء الاصطناعي يقرأ هذا المقال ويلخص النقاط الرئيسية.

أحيانًا كل ما يلزم لاختفاء موقع بالكامل من نتائج البحث هو سطر واحد فقط:

User-agent: *
Disallow: /

هذان السطران صحيحان في بيئة التطوير، لكن نقلهما بالخطأ إلى بيئة الإنتاج يمحو الموقع من جوجل تمامًا. هذا من أكثر الأخطاء التقنية شيوعًا وأعلاها تكلفة بعد إطلاق الموقع.

robots.txt وsitemap.xml هما قناتا التواصل الأساسيتان اللتان تُنشئهما مع محرك البحث. في هذا الدليل نشرح ماذا يفعل كل منهما، وكيف تكتبهما بشكل صحيح، وأين تُرتكب الأخطاء.

ما هو robots.txt وماذا يفعل؟

هو ملف نصي بسيط يقع في المجلد الجذر لموقعك (example.com/robots.txt). يُخبر بوتات محركات البحث أي الروابط يجب ألا تزحف إليها.

التمييز الجوهري: robots.txt يمنع الزحف، وليس الفهرسة.

يُخلط بين هذين المفهومين كثيرًا. إذا منعت صفحة عبر robots.txt، لن يستطيع جوجل قراءتها — لكن إذا كانت هناك مواقع أخرى تُشير إليها بروابط، فقد يُفهرسها دون رؤية محتواها. النتيجة سجل غريب في نتائج البحث بلا وصف واضح.

الهدفالأداة الصحيحةالسبب
ألا تظهر الصفحة في نتائج البحثوسم meta الخاص بـ noindexيقرأ جوجل الصفحة ويتعلم ألا يُفهرسها
ألا يُرهق البوت الخادمdisallow في robots.txtلا يتم الزحف إطلاقًا
ألا تُزحف الصفحة وألا تظهر معًاأولًا noindex، وبعد خروجها من الفهرس يُطبَّق disallowلا يمكن قراءة noindex في صفحة محظورة

السطر الأخير مهم: لا يستطيع جوجل رؤية وسم noindex في صفحة محظورة عبر robots.txt. إذا كنت تريد إخراج صفحة من الفهرس، ضع noindex أولًا، وتحقق من خروجها، ثم احظرها.

كيف تكتب ملف robots.txt صحيحًا؟

بالنسبة لمعظم المواقع، الملف المطلوب بسيط بهذا الشكل:

User-agent: *
Disallow: /wp-admin/
Disallow: /cart
Disallow: /checkout
Disallow: /search
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap.xml

القواعد:

  • User-agent يحدد أي بوت تُخاطب؛ * تعني الجميع.
  • Disallow يحدد المسار الذي لن يُزحف إليه. إذا تُرك فارغًا (Disallow:) فهذا يعني أن كل شيء مسموح.
  • Allow يفتح استثناءً داخل Disallow.
  • سطر Sitemap يُعطي الرابط الكامل لخريطة موقعك؛ يمكن أن يكون هناك أكثر من سطر واحد.
  • يجب أن يكون الملف بترميز UTF-8 وأن يقع في المجلد الجذر. ملف robots.txt في مجلد فرعي غير صالح.

الأماكن التي يُنصح بحظرها منطقيًا: لوحات الإدارة، خطوات السلة والدفع، صفحات نتائج البحث الداخلي في الموقع، تركيبات الفلاتر التي لا نهاية لها، والمناطق التي تحتوي بيانات شخصية.

ما يجب ألا يُحظر إطلاقًا: ملفات CSS وJavaScript. يحتاج جوجل إليها لعرض الصفحة كما يراها المستخدم؛ إذا حُظرت، تظهر الصفحة بشكل مكسور ويتأثر تقييم التوافق مع الجوّال سلبًا.

ما هو Sitemap.xml؟

خريطة الموقع هي قائمة بالروابط المهمة في موقعك. إنها الطريقة الأكثر مباشرة لتقول لجوجل "أريدك أن تزحف إلى هذه الروابط".

البنية الأساسية:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/</loc>
    <lastmod>2026-08-13</lastmod>
  </url>
  <url>
    <loc>https://example.com/services</loc>
    <lastmod>2026-07-02</lastmod>
  </url>
</urlset>

الحدود: حتى 50,000 رابط في الملف الواحد و50 ميجابايت (غير مضغوط). في المواقع الأكبر، يُستخدم فهرس خرائط المواقع (sitemap index):

<sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <sitemap><loc>https://example.com/sitemap-products.xml</loc></sitemap>
  <sitemap><loc>https://example.com/sitemap-blog.xml</loc></sitemap>
</sitemapindex>

الفائدة الخفية من التقسيم: في Search Console يُقدَّم تقرير كل خريطة موقع بشكل منفصل، فترى مباشرة أي قسم لا يدخل الفهرس. إذا كانت 90% من المنتجات مفهرسة لكن 30% فقط من المدونة مفهرسة، تجد مكان المشكلة بنظرة واحدة.

ستة أخطاء تُرتكب في خريطة الموقع

1. إدراج روابط يجب ألا تكون في الفهرس. الروابط التي تحمل noindex، أو التي يشير canonical فيها إلى صفحة أخرى، أو التي تُرجع 301 يجب ألا تكون في خريطة الموقع. خريطة الموقع تقول "هذا مهم"؛ وcanonical يقول "هذا ليس الأصل". عند تعارضهما، قد يتجاهل جوجل وسم canonical لديك.

2. تحديث حقل lastmod كل يوم. تجديد التاريخ رغم عدم تغيّر المحتوى يُفقد المصداقية؛ يتوقف جوجل بعد فترة عن الاهتمام بهذا الحقل. حدّثه فقط عندما يتغير المحتوى فعليًا.

3. إعطاء معنى لحقلي priority وchangefreq. يتجاهل جوجل هذين الحقلين إلى حد كبير. لا يستحق الأمر إضاعة الوقت.

4. خلط بروتوكولات ونطاقات فرعية مختلفة. يجب أن تتطابق الروابط داخل خريطة الموقع مع النطاق الذي توجد فيه خريطة الموقع نفسها، وأن تتطابق مع النسخة الكانونية.

5. ترك روابط تُرجع 404. يجب حذف الصفحات المحذوفة من خريطة الموقع أيضًا؛ وإلا تُهدر ميزانية الزحف لديك.

6. عدم إرسال خريطة الموقع إطلاقًا. من الشائع إنشاء الملف ونسيان إضافته إلى Search Console. إضافة سطر Sitemap: في robots.txt مفيدة أيضًا.

العلاقة مع ميزانية الزحف

بالنسبة للمواقع الصغيرة، ميزانية الزحف (crawl budget) ليست مشكلة. لكن في المواقع التي تُنتج عشرات الآلاف من الروابط، تنشأ هذه الحلقة: يزحف جوجل عددًا محدودًا من الصفحات؛ فإذا كانت هذه الصفحات مليئة بتركيبات فلاتر، لا يصل الدور إلى صفحات منتجاتك الحقيقية.

في هذه الحالة يصبح robots.txt رافعة حقيقية:

  • احظر تركيبات الفلاتر اللانهائية (Disallow: /*?color=)
  • احظر نتائج البحث الداخلي في الموقع
  • احظر الصفحات اللانهائية المبنية على التقويم أو التاريخ

لكن انتبه: الروابط الداخلية التي تشير إلى الصفحات التي تحظرها تذهب الآن إلى نقطة عمياء. راجع بنية الروابط الداخلية المؤدية إلى تلك الصفحات قبل حظرها.

التحقق بعد الإعداد

  1. افتح رابط example.com/robots.txt في المتصفح. يجب أن يُرجع 200 وأن يكون المحتوى قابلًا للقراءة.
  2. تحقق في Search Console ← الإعدادات ← تقرير robots.txt من استلام الملف وعدم وجود أخطاء.
  3. اختبر عدة صفحات مهمة بأداة فحص العناوين؛ يجب أن يقول سطر "هل الزحف مسموح؟" نعم.
  4. أرسل خريطة الموقع إلى Search Console وقارن بعد بضعة أيام بين عدد "الروابط المكتشفة" وعدد "المُفهرسة".
  5. إذا كان الفرق كبيرًا، راجع أسباب الاستبعاد في تقرير الصفحات.

كل هذه الخطوات مشروحة خطوة بخطوة بالصور في دليل Google Search Console.

قائمة تحقق عند الإطلاق

أكثر بندين يُنسيان عند إطلاق موقع جديد:

  • هل تمت إزالة سطر Disallow: / الخاص ببيئة التطوير؟
  • هل تم إيقاف خيار "منع محركات البحث" في إعدادات القالب؟

كلاهما يُصلَح بنقرة واحدة، لكن اكتشافهما قد يستغرق أسابيع. أول شيء يجب فعله يوم الإطلاق هو فتح robots.txt والتحقق منه. لمراجعة أشمل، اطّلع على قائمة فحص السيو التقني.

الأسئلة الشائعة

هل يُعاقب الموقع الذي لا يملك robots.txt؟

لا. إذا لم يكن الملف موجودًا، يعتبر جوجل كل شيء قابلًا للزحف. مع ذلك، إنشاؤه مفيد لأنه يحمل سطر خريطة الموقع.

هل يجب أن أحظر بوتات الذكاء الاصطناعي؟

القرار يعود إليك. يمكن حظر وكلاء المستخدم مثل GPTBot وClaudeBot وPerplexityBot عبر robots.txt. لكن إذا كنت تريد أن يُستشهد بمحتواك في إجابات الذكاء الاصطناعي، فإن حظرها يُفقدك الظهور — ناقشنا هذا التوازن في دليل GEO.

كم مرة يجب أن أُحدّث خريطة الموقع؟

أنشئها تلقائيًا. إذا لم يكن نظام إدارة المحتوى لديك يُحدّث خريطة الموقع عند إضافة صفحة جديدة، فإن الصيانة اليدوية لن تكون مستدامة.

الصفحة التي حظرتها ما زالت تظهر في جوجل، لماذا؟

robots.txt يمنع الزحف، وليس الفهرسة. لإخراج صفحة من الفهرس تحتاج إلى noindex — ولكي تتم قراءة noindex، يجب أن تكون الصفحة قابلة للزحف أصلًا.


مقالات ذات صلة:

شارك هذا المقال: