Lompat ke kandungan utama
6 minit bacaan

robots.txt dan sitemap.xml: dua fail kecil yang menentukan sama ada laman anda ditemui

Dua fail di akar laman mengawal apa yang crawler lihat dan apa yang disenaraikan. Panduan ringkas sintaks, had sebenar dan cara menyemaknya sendiri.

Webmaster robots.txtsitemappengindeksanSEOwebmaster
Peta kertas yang dilipat dan mangga kecil di atas meja kayu bersebelahan pintu pagar taman
Imej dijana AI.

robots.txt dan sitemap.xml duduk dalam folder yang sama di akar laman, tetapi kerja mereka bertentangan. robots.txt memberitahu crawler apa yang tidak boleh dilawati; sitemap.xml pula menyenaraikan URL yang awak mahu dilawati. Saiz kedua-duanya biasanya kurang daripada 1 KB, namun kesannya pada trafik carian boleh jauh lebih besar daripada saiznya. Di thalhah.my, robots.txt dan sitemap.xml masing-masing pulang kod HTTP 200 apabila disemak pada 5 Oktober 2026, dan itulah keadaan asas yang sepatutnya ada pada mana-mana laman.

Dua fail, dua fungsi yang tidak sama

robots.txt hanya dibaca pada satu lokasi, iaitu https://nama-domain-anda/robots.txt. Protokolnya bukan lagi adat lama: RFC 9309, diterbitkan pada September 2022 sebagai dokumen Standards Track oleh IETF, mengesahkan nama fail, sintaks dan tingkah laku crawler yang sebelum ini hanya menjadi amalan sejak 1994. Di dalam fail itu, setiap kumpulan bermula dengan baris user-agent, diikuti arahan Allow dan Disallow.

sitemap.xml pula fail XML yang berfungsi sebagai senarai cadangan, bukan arahan. Fail itu mesti dikodkan UTF-8, semua URL di dalamnya mesti URL mutlak yang bermula dengan https://, dan kesemuanya mesti datang daripada satu hos sahaja. Google membaca fail ini untuk menemui halaman yang mungkin tidak ditemui melalui pautan biasa.

robots.txt bukan kunci, dan bukan alat buang halaman

Dokumentasi Google Search Central menyatakan dengan jelas bahawa robots.txt bukan mekanisme untuk mengeluarkan halaman daripada hasil carian. Jika satu halaman disekat, URL itu masih boleh muncul dalam carian — cuma keterangannya hilang kerana crawler tidak dapat membaca kandungannya. Untuk benar-benar membuang halaman, kaedahnya ialah tag noindex atau kata laluan pada fail itu.

RFC 9309 turut menegaskan bahawa peraturan ini bukan bentuk kebenaran akses. Sebaliknya, menyenaraikan laluan sensitif di dalam robots.txt sebenarnya mendedahkan laluan itu kepada sesiapa yang membuka fail tersebut. Fasal 2.3.1.4 menyatakan bahawa jika robots.txt pulang ralat pelayan dalam julat kod 500 hingga 599, crawler wajib menganggap keseluruhan laman sebagai disallow. Fasal 2.3.1.3 pula memberi kelonggaran kepada crawler untuk menganggap fail itu tidak tersedia jika berlaku lebih daripada lima redirect berturut-turut.

Sintaks minimum yang benar-benar diperlukan

User-agent: *
Allow: /
Disallow: /adminpanel
Disallow: /api/

Sitemap: https://thalhah.my/sitemap.xml

Baris di atas menyerupai struktur robots.txt thalhah.my, yang pada 5 Oktober 2026 mengandungi lapan baris Disallow — antaranya /adminpanel, /api/, /pergi/ dan /contact-process.cfm — serta satu baris Sitemap yang menunjuk ke https://thalhah.my/sitemap.xml.

  • Setiap arahan memerlukan titik bertindih selepas kata kunci. Baris seperti Disallow /adminpanel tanpa titik bertindih diabaikan sepenuhnya.
  • Komen bermula dengan aksara # dan diabaikan sehingga hujung baris yang sama.
  • Satu baris kosong tidak mengubah apa-apa, tetapi baris user-agent baharu menamatkan kumpulan yang sebelumnya.
  • Baris Sitemap walaupun tidak ada dalam sintaks asal RFC, diterima oleh Google dan crawler utama sebagai cara mengumumkan lokasi sitemap.

Had sebenar sitemap: 50,000 URL dan 50 MB

Satu fail sitemap terhad kepada 50,000 URL atau 50 MB dalam bentuk tidak dimampatkan, dan had yang lebih rendah antara kedua-duanya akan dikenakan. Jika laman melebihi had itu, sitemap mesti dipecahkan kepada beberapa fail, kemudian digabungkan dengan satu fail indeks sitemap yang dihantar kepada enjin carian. Semua URL dalam satu sitemap mesti datang daripada satu hos, contohnya www.thalhah.my atau thalhah.my, tidak dicampur.

Protokol sitemap juga menetapkan setiap nilai <loc> mesti kurang daripada 2,048 aksara. Bagi tag pilihan, nilai <priority> lalai ialah 0.5 dalam julat 0.0 hingga 1.0, manakala <changefreq> menerima nilai seperti daily, weekly, monthly atau yearly. Google mengabaikan kedua-dua tag ini, tetapi masih menggunakan <lastmod> sekiranya tarikhnya tepat dan konsisten dengan tarikh fail itu benar-benar diubah.

Menurut Google Search Central, laman dengan kira-kira 500 halaman atau kurang selalunya tidak memerlukan sitemap jika setiap halaman penting boleh dicapai melalui pautan biasa. Sitemap paling berbaloi untuk laman baharu yang belum mempunyai banyak pautan luar, atau laman yang mempunyai banyak fail video dan imej yang mahu muncul dalam carian.

Tiga format sitemap yang diterima

Google menerima tiga keluarga format sitemap: XML, RSS/mRSS/Atom 1.0, dan teks biasa. XML paling fleksibel kerana ia boleh membawa maklumat tambahan tentang imej, video dan versi bahasa. Suapan RSS dan Atom lebih mudah kerana kebanyakan sistem pengurusan kandungan menjananya sendiri, tetapi ia biasanya hanya menyenaraikan URL terkini dan terhad kepada maklumat video. Sitemap teks pula paling ringkas, namun ia hanya boleh menyenaraikan URL halaman yang boleh diindeks.

Bila robots.txt berguna untuk fail media

Selain halaman, robots.txt boleh menghalang fail imej, video dan audio daripada muncul dalam hasil carian Google. Menurut dokumentasi Google, menyekat fail media tidak menghalang laman lain atau pengguna daripada memaut kepadanya terus. Manakala bagi halaman web yang disekat, imej, video dan PDF yang tertanam di dalamnya turut dikecualikan daripada crawling, kecuali fail itu dirujuk oleh halaman lain yang dibenarkan.

Lokasi fail menentukan skopnya

Google menasihatkan sitemap diletakkan di akar laman, dan sebabnya mudah diperiksa. Jika sitemap tidak dihantar melalui Search Console, ia hanya memberi kesan kepada fail dalam direktori induknya sahaja. Sitemap di https://thalhah.my/sitemap.xml merangkumi seluruh laman, tetapi sitemap yang diletakkan di dalam /blog/ hanya merangkumi kandungan bawah /blog/ sahaja. Ini juga sebabnya rujukan Sitemap dalam robots.txt biasanya menunjuk terus ke fail di akar domain.

Sekat crawling bukan sama dengan sekat indeks

Dua perkara ini sering dicampur. Menyekat crawling bermaksud crawler tidak melawat halaman, tetapi URL-nya masih boleh muncul dalam hasil carian tanpa keterangan. Menyekat indeks pula bermaksud halaman itu digugurkan daripada indeks sepenuhnya, dan caranya ialah tag meta noindex atau header respons X-Robots-Tag. Google mengesahkan bahawa arahan noindex di dalam robots.txt tidak disokong langsung; ia mesti berada dalam kod halaman atau header respons. Untuk fail bukan HTML seperti PDF, video dan imej, header X-Robots-Tag: noindex ialah pilihan yang sesuai kerana tiada tempat untuk meletakkan tag meta.

Cara menyemak dalam 10 minit

  • Semak kod respons dahulu. Hantar permintaan HTTP kepada /robots.txt dan /sitemap.xml; kedua-duanya perlu pulang 200, bukan 404, 403 atau 500.
  • Bandingkan lokasi sitemap yang ditulis dalam robots.txt dengan URL yang benar-benar wujud. Satu aksara tersalah taip sudah cukup untuk crawler mengabaikannya senyap-senyap.
  • Cari baris Disallow: / tanpa senarai. Satu baris itu sahaja menyekat keseluruhan laman daripada dilawati.
  • Pastikan fail sitemap dikodkan UTF-8 dan tiada aksara & mentah. Dalam XML, aksara itu mesti ditulis sebagai &amp; atau fail dianggap tidak sah.
  • Hantar sitemap melalui Google Search Console supaya laporan ralat muncul, dan buka semula laporan itu setiap bulan untuk melihat URL yang ditolak.

Mengapa perubahan tidak muncul serta-merta

Fasal 2.4 RFC 9309 menyatakan crawler tidak sepatutnya menggunakan salinan cache robots.txt lebih daripada 24 jam. Dalam amalan, selepas awak mengubah fail itu, bot boleh terus memakai versi lama sehingga kira-kira sehari. Jadi jangan panik jika halaman baharu belum dilawati pada jam yang sama. Bagi sitemap, masa pemprosesan bergantung pada saiz laman dan kekerapan Google melawatnya semula, yang boleh berbeza antara beberapa jam hingga beberapa hari.

Empat kesilapan yang memakan trafik

  • Menyekat seluruh laman secara tidak sengaja dengan Disallow: / melalui templat yang tersalah salin, kemudian menunggu berbulan-bulan sebelum menyedarinya.
  • Meletakkan laluan panel pentadbir dan fail pemprosesan borang dalam robots.txt. Laluan seperti /adminpanel dan /contact-process.cfm menjadi boleh ditemui oleh sesiapa yang membuka fail itu; cara yang betul ialah melindunginya dengan kata laluan atau menolak indeks dengan noindex.
  • Menyenaraikan URL yang sudah pulang 404 atau URL yang di-noindex dalam sitemap, yang membazirkan bajet crawling dan menghasilkan ralat dalam Search Console.
  • Menggantung sitemap di belakang rantaian redirect yang panjang atau di dalam direktori yang disekat oleh baris Disallow, sehingga crawler tidak pernah sampai kepadanya.

Susunan kerja yang selamat

Mulakan dengan menyalin robots.txt sedia ada ke fail sandaran sebelum menyentuhnya, kemudian uji satu perubahan pada satu masa. Jika laman dihoskan melalui sistem pengurusan kandungan, semak sama ada plugin atau tema menulis semula fail itu pada setiap kemas kini. Selepas sebarang perubahan, buka semula https://thalhah.my/robots.txt dan https://thalhah.my/sitemap.xml dalam pelayar untuk memastikan fail yang keluar adalah versi yang awak mahu, bukan versi lama daripada cache.

Ingat batas asasnya: robots.txt hanya arahan yang crawler memilih untuk hormati. Ia mengurangkan beban crawling dan menghalang halaman tertentu dilawati, tetapi ia bukan pengganti kata laluan, noindex atau kawalan akses sebenar.

Baca juga di laman ini

Sumber yang disemak

Maklumat dalam tulisan ini disemak dengan sumber di bawah. Bila keadaan berubah (harga, waktu, terma), sumber inilah yang paling tepat - bukan halaman ini.

Dapat tulisan baharu terus ke e-mel

Sekali sekala sahaja: panduan web, berita AI, dan tempat menarik di Kelantan. Tiada iklan, dan e-mel encik tidak dikongsi dengan sesiapa.

Berhenti langgan bila-bila masa, satu klik.

Komen pembaca

Belum ada komen pada artikel ini. Jadilah yang pertama.

Tinggalkan komen

Emel tidak akan dipaparkan.

Komen disemak dahulu sebelum dipaparkan.

Kongsi WhatsApp Facebook

Berkaitan halaman ini

Pautan afiliasi Shopee - saya mungkin menerima komisen, harga awak tetap sama.

Senarai penuh ada di kedai afiliasi.

Rujukan yang mungkin berguna

Pautan rujukan - anda dapat ganjaran pendaftaran, saya juga dapat ganjaran. Tiada kos tambahan untuk anda.

Minyak

Setel - Isi minyak di Petronas, dapat RM3

Setel ialah aplikasi pembayaran minyak di stesen Petronas — bayar terus dari telefon. Dengan kod rujukan di bawah, anda dan saya masing-masing menerima RM3 selepas anda belanja RM30 untuk minyak atau di Kedai Mesra.

Ganjaran: RM3 untuk kedua-dua pihak selepas belanja RM30 (tertakluk syarat Setel)

Kod: ffgaa

Daftar di Setel

Bank

GXBank — FlexiCredit - Had kredit peribadi sehingga RM150,000

GXBank ialah bank digital di Malaysia yang beroperasi sepenuhnya dalam aplikasi. FlexiCredit memberi had kredit peribadi sehingga RM150,000 yang boleh dikeluarkan serta-merta ke akaun GX apabila diperlukan. Memohon tidak dikenakan caj.

Ganjaran: Sehingga RM100 untuk anda selepas permohonan FlexiCredit diluluskan dan penarikan dibuat (tertakluk syarat GXBank)

Senarai penuh (bank digital, minyak, penghantaran) ada di halaman rujukan. Maklumat di atas ialah ringkasan terma penyedia - sila semak terma penuh di laman rasmi mereka.