Screpy - AI SEO অডিট টুল

বিনামূল্যের Robots.txt পরীক্ষক ও ভ্যালিডেটর

Google, AI সার্চ, ট্রেনিং ও কাস্টম ক্রলারের জন্য কোনো URL অনুমোদিত নাকি ব্লক করা তা পরীক্ষা করুন। প্রযোজ্য ঠিক কোন নিয়ম ও লাইন তা দেখতে লাইভ ওয়েবসাইট পরীক্ষা করুন অথবা robots.txt ফাইল পেস্ট করুন।

সার্চ, প্রশিক্ষণ ও ব্যবহারকারী-চালিত এজেন্টের উদ্দেশ্য আলাদা হতে পারে। প্রতিটি পণ্য টোকেন আলাদাভাবে পরীক্ষা করুন।

কোনো অ্যাকাউন্ট দরকার নেই। URL ও robots.txt কনটেন্ট সংরক্ষণ করা হয় না।

তিন ধাপে একটি ক্রল নিয়ম পরীক্ষা করুন।

প্রকল্প বা অ্যাকাউন্ট তৈরি না করেই একটি URL পরীক্ষা করুন। লাইভ মোড শুধু ওয়েবসাইটের পাবলিক robots.txt ফাইল পড়ে।

01

উৎস বেছে নিন

কোনো ওয়েবসাইট থেকে পাবলিক robots.txt ফাইল আনুন অথবা ব্রাউজারে ব্যক্তিগতভাবে পরীক্ষা করতে চাওয়া কনটেন্ট পেস্ট করুন।

02

একটি ক্রলার বেছে নিন

সার্চ, AI সার্চ, ট্রেনিং, ব্যবহারকারী-চালিত বা কাস্টম ক্রলারের product token বেছে নিয়ে পরীক্ষার URL path লিখুন।

03

সঠিক মিলটি দেখুন

URL অনুমোদিত কি না, কোন group প্রযোজ্য এবং ফলাফলের পেছনে ঠিক কোন Allow বা Disallow নিয়ম ও লাইন আছে তা দেখুন।

কোনো ক্রলার কেন অনুমোদিত বা ব্লক তা বুঝুন।

কার্যকর ফলাফলে শুধু সবুজ বা লাল স্ট্যাটাস নয়, সিদ্ধান্তের পেছনের নিয়মও দেখানো উচিত।

সবচেয়ে নির্দিষ্ট নিয়ম জেতে

পরীক্ষক longest-match আচরণ প্রয়োগ করে। সমান নির্দিষ্টতার Allow ও Disallow নিয়মে দ্বন্দ্ব হলে কম বাধাদানকারী Allow নিয়মটি জেতে।

Wildcard ও শেষের মিল

একাধিক character মেলাতে asterisk এবং পরীক্ষিত URL-এর শেষে নিয়মটি স্থির করতে dollar sign ব্যবহার করুন।

User-agent group গুরুত্বপূর্ণ

নির্দিষ্ট ক্রলারের group global * group-এর চেয়ে অগ্রাধিকার পায়। ভিন্ন সার্চ, ট্রেনিং ও ব্যবহারকারী-চালিত agent আলাদাভাবে পরীক্ষা করা উচিত।

কোনো নিয়ম না থাকলে ডিফল্ট অ্যাক্সেস

প্রযোজ্য কোনো Allow বা Disallow নিয়ম না মিললে robots exclusion protocol অনুযায়ী URL ডিফল্টভাবে অনুমোদিত।

Robots.txt অ্যাক্সেস নিয়ন্ত্রণ করে, সার্চে অন্তর্ভুক্তি নয়।

ক্রল নিয়ন্ত্রণ

Allow ও Disallow নিয়ম একটি সামঞ্জস্যপূর্ণ ক্রলারকে জানায় কোন URL পাথ অনুরোধ করা যাবে।

ইনডেক্স নিয়ন্ত্রণ

কোনো URL সার্চ ফলাফলে না দেখানো উচিত হলে ক্রলযোগ্য noindex নির্দেশনা ও সার্চ ইঞ্জিন অপসারণ ওয়ার্কফ্লো ব্যবহার করুন।

Robots.txt পরীক্ষক সম্পর্কে প্রশ্ন

ক্রল নিয়ম, AI crawler token, error state ও indexing সম্পর্কে পরিষ্কার উত্তর।

robots.txt পরীক্ষক কী করে?

একটি robots.txt পরীক্ষক কোনো crawler user-agent ও URL-কে robots.txt ফাইলের নিয়মের সঙ্গে তুলনা করে। এটি crawling অনুমোদিত কি না, কোন user-agent group প্রযোজ্য এবং থাকলে ঠিক কোন নিয়মটি মিলেছে তা দেখায়।

robots.txt কি কোনো পেজকে index হওয়া থেকে আটকায়?

নিজে থেকে নয়। Robots.txt crawling নিয়ন্ত্রণ করে, indexing নয়। ব্লক করা URL লিংকের মাধ্যমে আবিষ্কৃত হতে পারে এবং পূর্ণ snippet ছাড়াই দেখা যেতে পারে। Search result থেকে সরানো লক্ষ্য হলে crawl করা যায় এমন পেজে উপযুক্ত noindex directive ব্যবহার করুন।

“Allowed by default” বলতে কী বোঝায়?

এর অর্থ পরীক্ষক URL ব্লক করে এমন কোনো প্রযোজ্য নিয়ম পায়নি। মিলে যাওয়া user-agent group না থাকলে, মিলে যাওয়া group-এ প্রাসঙ্গিক নিয়ম না থাকলে অথবা ব্যবহারযোগ্য robots.txt ফাইল না থাকলে এটি হতে পারে।

Googlebot থেকে AI ক্রলার আলাদাভাবে পরীক্ষা করতে পারি?

হ্যাঁ। Search crawler, AI search crawler, model-training crawler ও user-triggered fetcher ভিন্ন product token ব্যবহার করে এবং তাদের নিয়মও ভিন্ন হতে পারে। প্রতিটির প্রযোজ্য নীতি পরীক্ষা করতে agent আলাদাভাবে বেছে নিন।

robots.txt-এ * ও $ কী বোঝায়?

Asterisk URL path-এর একাধিক character-এর সঙ্গে মেলে। Dollar sign কোনো pattern-কে URL-এর শেষে স্থির করে। সবচেয়ে নির্দিষ্ট প্রযোজ্য নিয়ম শনাক্ত করার সময় পরীক্ষক উভয় pattern সমর্থন করে।

robots.txt থেকে 404 বা 403 এলে কী হয়?

বড় ক্রলারগুলো সাধারণত অধিকাংশ 4xx response-কে কোনো crawl restriction প্রকাশিত হয়নি হিসেবে ধরে। 429 response ভিন্ন, কারণ এটি সাময়িক rate limiting বোঝায়; তাই পরীক্ষক অনির্ধারিত live state দেখায়।

5xx বা timeout ফলাফল অনির্ধারিত কেন?

সাময়িক server বা network failure কোনো crawler অনুমোদিত নাকি ব্লক করা তা প্রমাণ করে না। ক্রলার অনুরোধ থামাতে বা আগে cache করা robots.txt ফাইল ব্যবহার করতে পারে, তাই পরীক্ষক চূড়ান্ত নিয়মের সিদ্ধান্ত দেখায় না।

Screpy কি URL বা পেস্ট করা robots.txt কনটেন্ট সংরক্ষণ করে?

না। পেস্ট করা কনটেন্ট আপনার ব্রাউজারেই বিশ্লেষিত হয় এবং আপলোড করা হয় না। Live mode বর্তমান পরীক্ষার জন্য শুধু website, পরীক্ষিত URL ও নির্বাচিত crawler পাঠায়; টুলটি এসব input সংরক্ষণ করে না।