Chapter 4 of 9
Keempat mekanisme ini berbeda. Menggabungkannya tanpa model mental yang benar dapat membuat halaman tetap terindeks tetapi tidak dapat di-crawl.
| Mekanisme | Crawl | Index | URL utama |
|---|---|---|---|
| robots.txt | Ya | Tidak langsung | Tidak |
| meta robots | Tidak | Ya | Tidak |
| X-Robots-Tag | Tidak | Ya | Tidak |
| canonical | Tidak | Sinyal konsolidasi | Ya |
| sitemap | Discovery | Tidak | Sinyal URL pilihan |
User-agent: *
Disallow: /admin/
Disallow: /internal-search
Sitemap: https://example.com/sitemap.xml
Jangan memblokir CSS atau JavaScript untuk render. Robots.txt bukan perlindungan data rahasia; gunakan autentikasi dan otorisasi.
<meta name="robots" content="noindex,follow">
Untuk PDF atau resource non-HTML gunakan header X-Robots-Tag: noindex. Crawler harus dapat mengambil resource agar membaca directive; jangan menggabungkan Disallow dan noindex pada URL yang sama.
Canonical adalah hint kuat, bukan perintah absolut. Gunakan URL absolut, satu canonical per halaman, dan target 200 yang indexable.
Hanya masukkan URL canonical, 200, indexable, dan memang ingin ditemukan. lastmod harus menunjukkan perubahan substansial, bukan waktu request.
noindex.noindex.