robots.txt dan sitemap.xml: dua fail kecil yang menentukan sama ada laman anda ditemui
Dua fail di akar laman mengawal apa yang crawler lihat dan apa yang disenaraikan. Panduan ringkas sintaks, had sebenar dan cara menyemaknya sendiri.
robots.txt dan sitemap.xml duduk dalam folder yang sama di akar laman, tetapi kerja mereka bertentangan. robots.txt memberitahu crawler apa yang tidak boleh dilawati; sitemap.xml pula menyenaraikan URL yang awak mahu dilawati. Saiz kedua-duanya biasanya kurang daripada 1 KB, namun kesannya pada trafik carian boleh jauh lebih besar daripada saiznya. Di thalhah.my, robots.txt dan sitemap.xml masing-masing pulang kod HTTP 200 apabila disemak pada 5 Oktober 2026, dan itulah keadaan asas yang sepatutnya ada pada mana-mana laman.
Dua fail, dua fungsi yang tidak sama
robots.txt hanya dibaca pada satu lokasi, iaitu https://nama-domain-anda/robots.txt. Protokolnya bukan lagi adat lama: RFC 9309, diterbitkan pada September 2022 sebagai dokumen Standards Track oleh IETF, mengesahkan nama fail, sintaks dan tingkah laku crawler yang sebelum ini hanya menjadi amalan sejak 1994. Di dalam fail itu, setiap kumpulan bermula dengan baris user-agent, diikuti arahan Allow dan Disallow.
sitemap.xml pula fail XML yang berfungsi sebagai senarai cadangan, bukan arahan. Fail itu mesti dikodkan UTF-8, semua URL di dalamnya mesti URL mutlak yang bermula dengan https://, dan kesemuanya mesti datang daripada satu hos sahaja. Google membaca fail ini untuk menemui halaman yang mungkin tidak ditemui melalui pautan biasa.
robots.txt bukan kunci, dan bukan alat buang halaman
Dokumentasi Google Search Central menyatakan dengan jelas bahawa robots.txt bukan mekanisme untuk mengeluarkan halaman daripada hasil carian. Jika satu halaman disekat, URL itu masih boleh muncul dalam carian — cuma keterangannya hilang kerana crawler tidak dapat membaca kandungannya. Untuk benar-benar membuang halaman, kaedahnya ialah tag noindex atau kata laluan pada fail itu.
RFC 9309 turut menegaskan bahawa peraturan ini bukan bentuk kebenaran akses. Sebaliknya, menyenaraikan laluan sensitif di dalam robots.txt sebenarnya mendedahkan laluan itu kepada sesiapa yang membuka fail tersebut. Fasal 2.3.1.4 menyatakan bahawa jika robots.txt pulang ralat pelayan dalam julat kod 500 hingga 599, crawler wajib menganggap keseluruhan laman sebagai disallow. Fasal 2.3.1.3 pula memberi kelonggaran kepada crawler untuk menganggap fail itu tidak tersedia jika berlaku lebih daripada lima redirect berturut-turut.
Sintaks minimum yang benar-benar diperlukan
User-agent: *
Allow: /
Disallow: /adminpanel
Disallow: /api/
Sitemap: https://thalhah.my/sitemap.xml
Baris di atas menyerupai struktur robots.txt thalhah.my, yang pada 5 Oktober 2026 mengandungi lapan baris Disallow — antaranya /adminpanel, /api/, /pergi/ dan /contact-process.cfm — serta satu baris Sitemap yang menunjuk ke https://thalhah.my/sitemap.xml.
- Setiap arahan memerlukan titik bertindih selepas kata kunci. Baris seperti Disallow /adminpanel tanpa titik bertindih diabaikan sepenuhnya.
- Komen bermula dengan aksara # dan diabaikan sehingga hujung baris yang sama.
- Satu baris kosong tidak mengubah apa-apa, tetapi baris user-agent baharu menamatkan kumpulan yang sebelumnya.
- Baris Sitemap walaupun tidak ada dalam sintaks asal RFC, diterima oleh Google dan crawler utama sebagai cara mengumumkan lokasi sitemap.
Had sebenar sitemap: 50,000 URL dan 50 MB
Satu fail sitemap terhad kepada 50,000 URL atau 50 MB dalam bentuk tidak dimampatkan, dan had yang lebih rendah antara kedua-duanya akan dikenakan. Jika laman melebihi had itu, sitemap mesti dipecahkan kepada beberapa fail, kemudian digabungkan dengan satu fail indeks sitemap yang dihantar kepada enjin carian. Semua URL dalam satu sitemap mesti datang daripada satu hos, contohnya www.thalhah.my atau thalhah.my, tidak dicampur.
Protokol sitemap juga menetapkan setiap nilai <loc> mesti kurang daripada 2,048 aksara. Bagi tag pilihan, nilai <priority> lalai ialah 0.5 dalam julat 0.0 hingga 1.0, manakala <changefreq> menerima nilai seperti daily, weekly, monthly atau yearly. Google mengabaikan kedua-dua tag ini, tetapi masih menggunakan <lastmod> sekiranya tarikhnya tepat dan konsisten dengan tarikh fail itu benar-benar diubah.
Menurut Google Search Central, laman dengan kira-kira 500 halaman atau kurang selalunya tidak memerlukan sitemap jika setiap halaman penting boleh dicapai melalui pautan biasa. Sitemap paling berbaloi untuk laman baharu yang belum mempunyai banyak pautan luar, atau laman yang mempunyai banyak fail video dan imej yang mahu muncul dalam carian.
Tiga format sitemap yang diterima
Google menerima tiga keluarga format sitemap: XML, RSS/mRSS/Atom 1.0, dan teks biasa. XML paling fleksibel kerana ia boleh membawa maklumat tambahan tentang imej, video dan versi bahasa. Suapan RSS dan Atom lebih mudah kerana kebanyakan sistem pengurusan kandungan menjananya sendiri, tetapi ia biasanya hanya menyenaraikan URL terkini dan terhad kepada maklumat video. Sitemap teks pula paling ringkas, namun ia hanya boleh menyenaraikan URL halaman yang boleh diindeks.
Bila robots.txt berguna untuk fail media
Selain halaman, robots.txt boleh menghalang fail imej, video dan audio daripada muncul dalam hasil carian Google. Menurut dokumentasi Google, menyekat fail media tidak menghalang laman lain atau pengguna daripada memaut kepadanya terus. Manakala bagi halaman web yang disekat, imej, video dan PDF yang tertanam di dalamnya turut dikecualikan daripada crawling, kecuali fail itu dirujuk oleh halaman lain yang dibenarkan.
Lokasi fail menentukan skopnya
Google menasihatkan sitemap diletakkan di akar laman, dan sebabnya mudah diperiksa. Jika sitemap tidak dihantar melalui Search Console, ia hanya memberi kesan kepada fail dalam direktori induknya sahaja. Sitemap di https://thalhah.my/sitemap.xml merangkumi seluruh laman, tetapi sitemap yang diletakkan di dalam /blog/ hanya merangkumi kandungan bawah /blog/ sahaja. Ini juga sebabnya rujukan Sitemap dalam robots.txt biasanya menunjuk terus ke fail di akar domain.
Sekat crawling bukan sama dengan sekat indeks
Dua perkara ini sering dicampur. Menyekat crawling bermaksud crawler tidak melawat halaman, tetapi URL-nya masih boleh muncul dalam hasil carian tanpa keterangan. Menyekat indeks pula bermaksud halaman itu digugurkan daripada indeks sepenuhnya, dan caranya ialah tag meta noindex atau header respons X-Robots-Tag. Google mengesahkan bahawa arahan noindex di dalam robots.txt tidak disokong langsung; ia mesti berada dalam kod halaman atau header respons. Untuk fail bukan HTML seperti PDF, video dan imej, header X-Robots-Tag: noindex ialah pilihan yang sesuai kerana tiada tempat untuk meletakkan tag meta.
Cara menyemak dalam 10 minit
- Semak kod respons dahulu. Hantar permintaan HTTP kepada /robots.txt dan /sitemap.xml; kedua-duanya perlu pulang 200, bukan 404, 403 atau 500.
- Bandingkan lokasi sitemap yang ditulis dalam robots.txt dengan URL yang benar-benar wujud. Satu aksara tersalah taip sudah cukup untuk crawler mengabaikannya senyap-senyap.
- Cari baris Disallow: / tanpa senarai. Satu baris itu sahaja menyekat keseluruhan laman daripada dilawati.
- Pastikan fail sitemap dikodkan UTF-8 dan tiada aksara & mentah. Dalam XML, aksara itu mesti ditulis sebagai & atau fail dianggap tidak sah.
- Hantar sitemap melalui Google Search Console supaya laporan ralat muncul, dan buka semula laporan itu setiap bulan untuk melihat URL yang ditolak.
Mengapa perubahan tidak muncul serta-merta
Fasal 2.4 RFC 9309 menyatakan crawler tidak sepatutnya menggunakan salinan cache robots.txt lebih daripada 24 jam. Dalam amalan, selepas awak mengubah fail itu, bot boleh terus memakai versi lama sehingga kira-kira sehari. Jadi jangan panik jika halaman baharu belum dilawati pada jam yang sama. Bagi sitemap, masa pemprosesan bergantung pada saiz laman dan kekerapan Google melawatnya semula, yang boleh berbeza antara beberapa jam hingga beberapa hari.
Empat kesilapan yang memakan trafik
- Menyekat seluruh laman secara tidak sengaja dengan Disallow: / melalui templat yang tersalah salin, kemudian menunggu berbulan-bulan sebelum menyedarinya.
- Meletakkan laluan panel pentadbir dan fail pemprosesan borang dalam robots.txt. Laluan seperti /adminpanel dan /contact-process.cfm menjadi boleh ditemui oleh sesiapa yang membuka fail itu; cara yang betul ialah melindunginya dengan kata laluan atau menolak indeks dengan noindex.
- Menyenaraikan URL yang sudah pulang 404 atau URL yang di-noindex dalam sitemap, yang membazirkan bajet crawling dan menghasilkan ralat dalam Search Console.
- Menggantung sitemap di belakang rantaian redirect yang panjang atau di dalam direktori yang disekat oleh baris Disallow, sehingga crawler tidak pernah sampai kepadanya.
Susunan kerja yang selamat
Mulakan dengan menyalin robots.txt sedia ada ke fail sandaran sebelum menyentuhnya, kemudian uji satu perubahan pada satu masa. Jika laman dihoskan melalui sistem pengurusan kandungan, semak sama ada plugin atau tema menulis semula fail itu pada setiap kemas kini. Selepas sebarang perubahan, buka semula https://thalhah.my/robots.txt dan https://thalhah.my/sitemap.xml dalam pelayar untuk memastikan fail yang keluar adalah versi yang awak mahu, bukan versi lama daripada cache.
Halaman ini dicetak tanpa menu, borang langgan dan jalur sisi.
Baca juga di laman ini
- Kenapa laman awak lambat: 7 punca paling kerap Kelajuan pelayan menentukan sejauh mana crawler dapat menjelajah dalam satu sesi.
- Structured data (JSON-LD): apa gunanya dan cara menyemaknya Selepas crawler menemui halaman, data berstruktur membantu ia memahami kandungan.
- DNS tanpa jargon: rekod A, CNAME, MX dan TXT Masalah DNS pada domain boleh membuat robots.txt tidak dapat diakses langsung.
- Gambar laman web: format, saiz dan kesan sebenar pada kelajuan Aset imej yang berat melambatkan crawl dan membazirkan bajet crawling.
Sumber yang disemak
Maklumat dalam tulisan ini disemak dengan sumber di bawah. Bila keadaan berubah (harga, waktu, terma), sumber inilah yang paling tepat - bukan halaman ini.
- RFC 9309: Robots Exclusion Protocol (IETF, September 2022)
- Google Search Central: Introduction to robots.txt
- Google Search Central: Learn about sitemaps
- Google Search Central: Build and submit a sitemap
- Sitemaps.org: format XML dan protokol sitemap
- Google Search Central: Block Search indexing with noindex
Dapat tulisan baharu terus ke e-mel
Sekali sekala sahaja: panduan web, berita AI, dan tempat menarik di Kelantan. Tiada iklan, dan e-mel encik tidak dikongsi dengan sesiapa.