উৎস বেছে নিন
কোনো ওয়েবসাইট থেকে পাবলিক robots.txt ফাইল আনুন অথবা ব্রাউজারে ব্যক্তিগতভাবে পরীক্ষা করতে চাওয়া কনটেন্ট পেস্ট করুন।
Google, AI সার্চ, ট্রেনিং ও কাস্টম ক্রলারের জন্য কোনো URL অনুমোদিত নাকি ব্লক করা তা পরীক্ষা করুন। প্রযোজ্য ঠিক কোন নিয়ম ও লাইন তা দেখতে লাইভ ওয়েবসাইট পরীক্ষা করুন অথবা robots.txt ফাইল পেস্ট করুন।
প্রকল্প বা অ্যাকাউন্ট তৈরি না করেই একটি URL পরীক্ষা করুন। লাইভ মোড শুধু ওয়েবসাইটের পাবলিক robots.txt ফাইল পড়ে।
কোনো ওয়েবসাইট থেকে পাবলিক robots.txt ফাইল আনুন অথবা ব্রাউজারে ব্যক্তিগতভাবে পরীক্ষা করতে চাওয়া কনটেন্ট পেস্ট করুন।
সার্চ, AI সার্চ, ট্রেনিং, ব্যবহারকারী-চালিত বা কাস্টম ক্রলারের product token বেছে নিয়ে পরীক্ষার URL path লিখুন।
URL অনুমোদিত কি না, কোন group প্রযোজ্য এবং ফলাফলের পেছনে ঠিক কোন Allow বা Disallow নিয়ম ও লাইন আছে তা দেখুন।
কার্যকর ফলাফলে শুধু সবুজ বা লাল স্ট্যাটাস নয়, সিদ্ধান্তের পেছনের নিয়মও দেখানো উচিত।
পরীক্ষক longest-match আচরণ প্রয়োগ করে। সমান নির্দিষ্টতার Allow ও Disallow নিয়মে দ্বন্দ্ব হলে কম বাধাদানকারী Allow নিয়মটি জেতে।
একাধিক character মেলাতে asterisk এবং পরীক্ষিত URL-এর শেষে নিয়মটি স্থির করতে dollar sign ব্যবহার করুন।
নির্দিষ্ট ক্রলারের group global * group-এর চেয়ে অগ্রাধিকার পায়। ভিন্ন সার্চ, ট্রেনিং ও ব্যবহারকারী-চালিত agent আলাদাভাবে পরীক্ষা করা উচিত।
প্রযোজ্য কোনো Allow বা Disallow নিয়ম না মিললে robots exclusion protocol অনুযায়ী URL ডিফল্টভাবে অনুমোদিত।
Allow ও Disallow নিয়ম একটি সামঞ্জস্যপূর্ণ ক্রলারকে জানায় কোন URL পাথ অনুরোধ করা যাবে।
কোনো URL সার্চ ফলাফলে না দেখানো উচিত হলে ক্রলযোগ্য noindex নির্দেশনা ও সার্চ ইঞ্জিন অপসারণ ওয়ার্কফ্লো ব্যবহার করুন।
ক্রল নিয়ম, AI crawler token, error state ও indexing সম্পর্কে পরিষ্কার উত্তর।
একটি robots.txt পরীক্ষক কোনো crawler user-agent ও URL-কে robots.txt ফাইলের নিয়মের সঙ্গে তুলনা করে। এটি crawling অনুমোদিত কি না, কোন user-agent group প্রযোজ্য এবং থাকলে ঠিক কোন নিয়মটি মিলেছে তা দেখায়।
এর অর্থ পরীক্ষক URL ব্লক করে এমন কোনো প্রযোজ্য নিয়ম পায়নি। মিলে যাওয়া user-agent group না থাকলে, মিলে যাওয়া group-এ প্রাসঙ্গিক নিয়ম না থাকলে অথবা ব্যবহারযোগ্য robots.txt ফাইল না থাকলে এটি হতে পারে।
বড় ক্রলারগুলো সাধারণত অধিকাংশ 4xx response-কে কোনো crawl restriction প্রকাশিত হয়নি হিসেবে ধরে। 429 response ভিন্ন, কারণ এটি সাময়িক rate limiting বোঝায়; তাই পরীক্ষক অনির্ধারিত live state দেখায়।
হ্যাঁ। Search crawler, AI search crawler, model-training crawler ও user-triggered fetcher ভিন্ন product token ব্যবহার করে এবং তাদের নিয়মও ভিন্ন হতে পারে। প্রতিটির প্রযোজ্য নীতি পরীক্ষা করতে agent আলাদাভাবে বেছে নিন।
Asterisk URL path-এর একাধিক character-এর সঙ্গে মেলে। Dollar sign কোনো pattern-কে URL-এর শেষে স্থির করে। সবচেয়ে নির্দিষ্ট প্রযোজ্য নিয়ম শনাক্ত করার সময় পরীক্ষক উভয় pattern সমর্থন করে।
সাময়িক server বা network failure কোনো crawler অনুমোদিত নাকি ব্লক করা তা প্রমাণ করে না। ক্রলার অনুরোধ থামাতে বা আগে cache করা robots.txt ফাইল ব্যবহার করতে পারে, তাই পরীক্ষক চূড়ান্ত নিয়মের সিদ্ধান্ত দেখায় না।
নিজে থেকে নয়। Robots.txt crawling নিয়ন্ত্রণ করে, indexing নয়। ব্লক করা URL লিংকের মাধ্যমে আবিষ্কৃত হতে পারে এবং পূর্ণ snippet ছাড়াই দেখা যেতে পারে। Search result থেকে সরানো লক্ষ্য হলে crawl করা যায় এমন পেজে উপযুক্ত noindex directive ব্যবহার করুন।
না। পেস্ট করা কনটেন্ট আপনার ব্রাউজারেই বিশ্লেষিত হয় এবং আপলোড করা হয় না। Live mode বর্তমান পরীক্ষার জন্য শুধু website, পরীক্ষিত URL ও নির্বাচিত crawler পাঠায়; টুলটি এসব input সংরক্ষণ করে না।