AEO Saigon
Kiến thức

AI Crawlers, robots.txt cho AI và llms.txt: Kiểm Soát Nội Dung Nào Được AI Học

Mục lục bài viết

Năm 2026, không chỉ Google bot mà hàng chục AI crawler đang crawl web liên tục để huấn luyện mô hình AI và cung cấp câu trả lời real-time. Doanh nghiệp Việt Nam cần hiểu rõ: ai đang đọc nội dung của mình, quyền kiểm soát ở đâu, và cách tận dụng điều này cho AEO.

Danh sách AI crawlers chính (2026)

CrawlerNhà phát triểnUser-AgentMục đích
GPTBotOpenAIGPTBot/1.1Training + Browse Web
ClaudeBotAnthropicClaudeBot/0.1Training + web search
PerplexityBotPerplexity AIPerplexityBot/1.0Real-time search
Meta-ExternalAgentMetameta-externalagent/1.1Training Llama
BytespiderByteDanceBytespiderTraining + TikTok AI
Applebot-ExtendedAppleApplebot-Extended/0.1Apple Intelligence
Google-ExtendedGoogleGoogle-ExtendedTraining Gemini
CCBotCommon CrawlCCBot/2.0Open dataset (training data nguồn mở)
AmazonbotAmazonAmazonbot/0.1Training Alexa/Bedrock
cohere-aiCoherecohere-ai/1.0Training API models

Kiểm soát bằng robots.txt

Chặn hoàn toàn một crawler

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Chặn theo path cụ thể (khuyến nghị)

# Cho phép AI crawl blog và trang marketing
User-agent: GPTBot
Allow: /vi/blog/
Allow: /vi/dich-vu/
Disallow: /api/
Disallow: /admin/
Disallow: /khach-hang/
Disallow: /bao-cao/
Disallow: /

User-agent: ClaudeBot
Allow: /vi/blog/
Allow: /vi/dich-vu/
Disallow: /

# Cho phép Perplexity (real-time search — cần để xuất hiện trong Perplexity)
User-agent: PerplexityBot
Allow: /
Disallow: /api/
Disallow: /admin/

# Chặn Meta và ByteDance (không muốn training Llama/TikTok AI)
User-agent: meta-externalagent
Disallow: /

User-agent: Bytespider
Disallow: /

Cho phép tất cả AI crawlers (chiến lược AEO)

# Cho phép toàn bộ AI crawlers — tối ưu cho AEO
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

# Vẫn bảo vệ các path nhạy cảm
User-agent: *
Disallow: /api/
Disallow: /admin/
Disallow: /.env

Tiêu chuẩn llms.txt

llms.txt là file đặt tại root của domain (/llms.txt), giúp AI hiểu cấu trúc và nội dung website theo cách có cấu trúc — giống sitemap.xml nhưng dành cho ngữ nghĩa.

Cấu trúc llms.txt cơ bản

# AEO Saigon

> Agency chuyên AEO (Answer Engine Optimization) và JSON-LD schema cho doanh nghiệp Việt Nam muốn xuất hiện trong AI search và Google rich results.

AEO Saigon giúp SME tại TP.HCM và Hà Nội xây dựng hiện diện trong Google AI Overview, ChatGPT, Perplexity và Gemini thông qua structured data và content strategy.

## Tài liệu quan trọng

- [Hướng dẫn AEO cho SME Việt Nam](https://example.vn/vi/blog/aeo-guide): Tổng quan về Answer Engine Optimization và cách bắt đầu
- [JSON-LD Schema cơ bản](https://example.vn/vi/blog/json-ld-schema): Organization, LocalBusiness, FAQPage
- [Dịch vụ AEO](https://example.vn/vi/dich-vu/aeo): Gói dịch vụ và báo giá
- [Case Study](https://example.vn/vi/case-study): Kết quả thực tế từ khách hàng

## Điều kiện sử dụng

Nội dung blog có thể được AI trích dẫn với attribution. Không được sử dụng để training mô hình thương mại mà không có thỏa thuận bằng văn bản.

llms.txt đầy đủ cho doanh nghiệp

# Tên Công Ty / Thương Hiệu

> [Mô tả ngắn 1-2 câu về công ty và giá trị cốt lõi]

[Đoạn mô tả chi tiết hơn, 3-5 câu, về sản phẩm/dịch vụ, thị trường phục vụ, và điểm khác biệt]

## Sản phẩm/Dịch vụ

- [Tên sản phẩm 1](URL): Mô tả ngắn
- [Tên sản phẩm 2](URL): Mô tả ngắn

## Tài liệu kỹ thuật

- [Tài liệu API](URL): Nếu có API public
- [Hướng dẫn tích hợp](URL)

## Blog & Tài nguyên

- [Tên bài blog chính 1](URL): Chủ đề
- [Tên bài blog chính 2](URL): Chủ đề

## Thông tin liên hệ

- Website: https://example.vn
- Email: contact@example.vn
- Địa chỉ: [Địa chỉ đầy đủ]

## Điều kiện sử dụng nội dung

[Nêu rõ: AI được phép/không được phép dùng nội dung này như thế nào]

Triển khai llms.txt trong Next.js

// app/llms.txt/route.ts
import { NextResponse } from "next/server";

export async function GET() {
  const content = `# AEO Saigon

> Agency chuyên AEO và JSON-LD schema cho SME Việt Nam.

AEO Saigon giúp doanh nghiệp xuất hiện trong Google AI Overview, ChatGPT, và Perplexity thông qua structured data strategy.

## Blog

${await getBlogList()}

## Dịch vụ

- [AEO Audit](https://aeosaigon.com/vi/dich-vu/aeo-audit): Kiểm tra và tối ưu hóa schema
- [Schema Implementation](https://aeosaigon.com/vi/dich-vu/schema): Triển khai JSON-LD đầy đủ
`;

  return new NextResponse(content, {
    headers: { "Content-Type": "text/plain; charset=utf-8" },
  });
}

async function getBlogList(): Promise<string> {
  // Lấy danh sách bài blog từ CMS/file system
  const posts = await getBlogPosts();
  return posts
    .map((p) => `- [${p.title}](https://aeosaigon.com/vi/blog/${p.slug}): ${p.description}`)
    .join("\n");
}

Ma trận quyết định: Nên cho phép hay chặn?

Loại nội dungGPTBotClaudeBotPerplexityBotGoogle-Extended
Blog marketing, hướng dẫn✅ Cho phép✅ Cho phép✅ Cho phép✅ Cho phép
Trang dịch vụ, giới thiệu✅ Cho phép✅ Cho phép✅ Cho phép✅ Cho phép
Bảng giá public✅ Cho phép✅ Cho phép✅ Cho phép⚠️ Tùy
Database sản phẩm (e-commerce)⚠️ Tùy⚠️ Tùy✅ Cho phép⚠️ Tùy
Nội dung premium/trả phí❌ Chặn❌ Chặn❌ Chặn❌ Chặn
Thông tin khách hàng❌ Chặn❌ Chặn❌ Chặn❌ Chặn
API endpoints❌ Chặn❌ Chặn❌ Chặn❌ Chặn
Admin/CMS❌ Chặn❌ Chặn❌ Chặn❌ Chặn

Checklist kiểm tra AI crawlers

  • Kiểm tra server logs cho các User-Agent AI crawlers
  • Review robots.txt hiện tại — có đang chặn AI crawlers không
  • Quyết định chiến lược: cho phép, chặn theo path, hay chặn toàn bộ
  • Tạo /llms.txt với mô tả tổ chức và danh sách trang quan trọng
  • Đảm bảo /api/, /admin/, data path đều có Disallow cho tất cả bots
  • Verify robots.txt với Google Search Console > robots.txt Tester
  • Theo dõi traffic từ AI crawlers hàng tháng

Kiểm soát AI crawlers không phải là chặn tất cả hay cho phép tất cả. Chiến lược đúng là: cho phép AI truy cập nội dung mang giá trị thương hiệu (blog, landing page, dịch vụ), chặn nội dung nhạy cảm và internal tools — rồi hướng dẫn AI qua llms.txt để đảm bảo AI hiểu đúng về tổ chức của bạn.

Câu hỏi thường gặp

AI crawlers khác Google bot như thế nào?

Google bot crawl để lập chỉ mục trang web cho kết quả tìm kiếm — bạn vẫn kiểm soát được thông qua robots.txt và noindex. AI crawlers (GPTBot, ClaudeBot, PerplexityBot, Meta-ExternalAgent) crawl để thu thập dữ liệu training cho mô hình AI hoặc để cung cấp câu trả lời real-time. Điểm khác biệt quan trọng: Chặn Google bot ảnh hưởng đến SEO truyền thống. Chặn AI crawlers KHÔNG ảnh hưởng đến SEO Google — nhưng ảnh hưởng đến khả năng AI trích dẫn nội dung của bạn. Một số AI (Perplexity, Bing Copilot) crawl real-time khi có câu hỏi — chặn bot này có nghĩa AI sẽ không tìm thấy nội dung mới nhất của bạn.

Nếu chặn GPTBot, nội dung tôi có bị xóa khỏi ChatGPT không?

Không — chặn GPTBot ngăn OpenAI crawl trang của bạn trong tương lai, nhưng không xóa dữ liệu đã thu thập trước đó. Training data của GPT-4o và các model trước đó đã được thu thập — chặn bot bây giờ chỉ ảnh hưởng đến future training runs và real-time web search (khi ChatGPT Browse Web dùng GPTBot). Để yêu cầu xóa dữ liệu đã có: liên hệ trực tiếp với nhà phát triển AI thông qua privacy request — robots.txt không có tác dụng xóa dữ liệu đã thu thập.

llms.txt là gì và có bắt buộc không?

llms.txt là chuẩn mới (2025) đặt tại /llms.txt, cho phép website chỉ dẫn AI về cách sử dụng nội dung — tương tự robots.txt nhưng dành riêng cho Large Language Models. File này chứa: mô tả ngắn về tổ chức, danh sách các trang/tài liệu quan trọng mà AI nên đọc, điều khoản sử dụng nội dung. Không bắt buộc, nhưng đang được các AI assistant lớn (Claude, Perplexity) tích hợp để hiểu website tốt hơn. Cho doanh nghiệp Việt Nam muốn AI trích dẫn đúng: llms.txt là đầu tư nhỏ với ROI cao.

Tôi nên cho phép hay chặn AI crawlers?

Tuỳ vào mục tiêu kinh doanh. Nên cho phép nếu: (1) muốn AI trích dẫn content và brand của bạn khi trả lời người dùng, (2) đang xây dựng authority trong ngành qua AEO, (3) content không chứa thông tin nhạy cảm hoặc độc quyền. Nên cân nhắc chặn nếu: (1) có database hoặc nội dung trả phí không muốn AI học, (2) trang thương mại nhạy cảm (giá, hợp đồng), (3) thông tin cá nhân khách hàng (phải chặn theo PDPA/GDPR). Chiến lược tốt nhất: chặn theo path cụ thể thay vì chặn toàn bộ.

Làm sao kiểm tra AI crawler nào đã và đang crawl site của tôi?

Xem server logs (access logs) — lọc theo User-Agent chứa 'GPTBot', 'ClaudeBot', 'PerplexityBot', 'Bytespider'. Với Nginx: grep 'GPTBot' /var/log/nginx/access.log. Với Google Search Console: dữ liệu crawl chỉ hiển thị Googlebot, không hiển thị AI crawlers khác. Với Cloudflare: Analytics > Bot Analytics cho thấy traffic từ known bots theo category. Theo dõi thường xuyên giúp phát hiện crawlers mới chưa được biết đến và điều chỉnh robots.txt kịp thời.

AEO Saigon

Agency Answer Engine Optimization tại TP. Hồ Chí Minh — giúp website doanh nghiệp được AI trích dẫn. Về AEO Saigon →

Muốn website của bạn được AI trích dẫn như vậy?

Audit miễn phí