# DCMI allows all crawlers, including AI training, search, and retrieval bots. # DCMI's mission is open metadata standards; broad machine readability # supports that mission. Explicit per-agent entries follow RFC 9309 best # practice and satisfy validators that require more than a wildcard rule. # # Content-Signal declares DCMI's usage preferences per the AIPREF draft # (draft-romm-aipref-contentsignals): all three signals are affirmative. User-agent: * Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- OpenAI --- User-agent: GPTBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: ChatGPT-User Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: OAI-SearchBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Anthropic --- User-agent: ClaudeBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Claude-Web Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Claude-User Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Claude-SearchBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: anthropic-ai Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Google --- User-agent: Google-Extended Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: GoogleOther Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Apple --- User-agent: Applebot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Applebot-Extended Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Microsoft / Bing --- User-agent: bingbot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Meta --- User-agent: Meta-ExternalAgent Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Meta-ExternalFetcher Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: FacebookBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Amazon --- User-agent: Amazonbot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Perplexity --- User-agent: PerplexityBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Perplexity-User Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Cohere --- User-agent: cohere-ai Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: cohere-training-data-crawler Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Mistral --- User-agent: MistralAI-User Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- ByteDance / TikTok --- User-agent: Bytespider Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Common Crawl (training data for many LLMs) --- User-agent: CCBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- You.com --- User-agent: YouBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- DuckDuckGo --- User-agent: DuckAssistBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Allen Institute for AI --- User-agent: AI2Bot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: AI2Bot-Dolma Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Huawei --- User-agent: PanguBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Timpi --- User-agent: Timpibot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Diffbot --- User-agent: Diffbot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- ImagesiftBot (The Hive) --- User-agent: ImagesiftBot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Omgili / Webz.io --- User-agent: Omgili Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: omgilibot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Webzio-Extended Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # --- Misc AI training / agentic crawlers --- User-agent: FriendlyCrawler Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: ISSCyberRiskCrawler Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Kangaroo Bot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: iaskspider Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Iaskspider/2.0 Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: SemrushBot-OCOB Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Velen Crawler Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Scrapy Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / User-agent: Sidetrade indexer bot Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / Sitemap: https://www.dublincore.org/sitemap.xml