Robots.txt là một tệp văn bản nằm trong thư mục gốc của trang web chỉ định cho trình thu thập thông tin của công cụ tìm kiếm cho những trang web và tệp nào bạn muốn hoặc không muốn truy cập. Thông thường, chủ sở hữu trang web cố gắng để được các công cụ tìm kiếm chú ý, nhưng có những trường hợp không cần thiết: Chẳng hạn, nếu bạn lưu trữ dữ liệu nhạy cảm hoặc bạn muốn tiết kiệm băng thông bằng cách không lập chỉ mục trừ các trang nặng có hình ảnh. 

- Khi trình thu thập thông tin truy cập vào một trang web, nó sẽ yêu cầu một tệp có tên '/robots.txt' ở vị trí đầu tiên. Nếu một tập tin như vậy được tìm thấy, trình thu thập thông tin sẽ kiểm tra nó để biết hướng dẫn lập chỉ mục trang web. 

- LƯU Ý: Chỉ có thể có một tệp robots.txt cho trang web. Một tệp robots.txt cho một tên miền addon cần được đặt vào gốc tài liệu tương ứng.

- Robot.txt bao gồm các dòng chứa hai trường: một dòng có tên tác nhân người dùng (trình thu thập công cụ tìm kiếm) và một hoặc một số dòng bắt đầu bằng lệnh

  Disallow:

- Robots.txt được tạo ở định dạng văn bản UNIX. 

1. Thông tin cơ bản về cú pháp robot.txt

- Thông thường, tệp robot.txt chứa nội dung như sau:

 

User-agent: * 

   Disallow: /cgi-bin/ 

   Disallow: /tmp/ 

   Disallow: /~different/

 

- Trong ví dụ này có ba thư mục: '/ cgi -bin / ',' / tmp / 'và' / ~ khác nhau / 'được loại trừ khỏi chỉ mục. 

- CHÚ THÍCH: Mỗi thư mục được viết trên một dòng riêng biệt. Bạn không thể viết 'Disallow: / cgi-bin / / tmp /' trong một dòng, bạn cũng không thể chia một lệnh Disallow hoặc User-agent thành nhiều dòng - sử dụng một dòng mới để tách các lệnh khác nhau. 

- 'Sao' (*) trong trường Tác nhân người dùng có nghĩa là 'bất kỳ trình thu thập dữ liệu web nào'. Do đó, các chỉ thị thuộc loại 'Disallow: *.gif' hoặc 'User-agent: Mozilla' không được hỗ trợ - vui lòng chú ý đến các lỗi logic như vậy vì chúng là những lỗi phổ biến nhất. 

- Các lỗi phổ biến khác là lỗi chính tả - thư mục sai chính tả, tác nhân người dùng, dấu hai chấm bị thiếu sau User-agent và Disallow, v.v. Khi các tệp robot.txt của bạn ngày càng phức tạp hơn và rất dễ xảy ra lỗi, có một số xác nhận các công cụ có ích: http: //tool.motoricerca.

2. Ví dụ về cách sử dụng file robots.txt

Dưới đây là một số ví dụ hữu ích về việc sử dụng robots.txt: 

- Ngăn chặn toàn bộ trang web khỏi việc lập chỉ mục bởi tất cả các trình thu thập dữ liệu web:

 

  User-agent: * 

   Disallow: / 

 

- Cho phép tất cả các trình thu thập dữ liệu lập chỉ mục cho toàn bộ trang:

 

   User-agent: * 

   Disallow: 

 

- Chỉ ngăn một số thư mục từ lập chỉ mục:

 

   User-agent: * 

   Disallow: /cgi-bin/ 

 

- Ngăn chặn lập chỉ mục của trang web bằng một trình crawl dữ liệu web cụ thể:

 

   User-agent: Bot1 

   Disallow: / 

 

- Tìm danh sách có tên của tất cả các user-agent ở đây . 

- Cho phép lập chỉ mục cho trình thu thập dữ liệu web cụ thể và ngăn chỉ mục từ người khác:

 

   User-agent: Opera 9 

   Disallow: 

   User-agent: * 

   Disallow: / 

 

- Ngăn chặn tất cả các tệp khỏi lập chỉ mục ngoại trừ một tệp duy nhất. 

Điều này khá khó khăn vì chỉ thị 'Allow' không tồn tại. Thay vào đó, bạn có thể di chuyển tất cả các tệp sang một thư mục con nhất định và ngăn chỉ mục của nó ngoại trừ một tệp mà bạn cho phép được lập chỉ mục:

 

   User-agent: * 

   Disallow: /docs/ 

3. Robots.txt và SEO

- Loại bỏ loại trừ hình ảnh

+ Tệp robot.txt mặc định trong một số phiên bản CMS được thiết lập để loại trừ thư mục hình ảnh của bạn. Vấn đề này không xảy ra trong các phiên bản CMS mới nhất, nhưng cần kiểm tra các phiên bản cũ hơn.

+ Loại trừ này có nghĩa là hình ảnh của bạn sẽ không được lập chỉ mục và đưa vào Tìm kiếm hình ảnh của Google, đây là điều bạn muốn, vì nó làm tăng thứ hạng SEO của bạn. 

+ Nếu bạn muốn thay đổi điều này, hãy mở tệp robot.txt của bạn và xóa dòng có nội dung: 

   Disallow: /images/ 

- Thêm tham chiếu vào tệp Sitemap.xml của bạn 

Nếu bạn có tệp sitemap.xml (và bạn nên có nó để tăng thứ hạng SEO của bạn), sẽ rất tốt nếu bao gồm dòng sau trong tệp robot.txt của bạn: 

   sitemap: http: //www.domain.com/sitemap.xml 

(Dòng này cần được cập nhật với tên miền và tệp sơ đồ trang web của bạn ). 

- Một số góp ý:
  • Không chặn CSS, Javascript và các tệp tài nguyên khác theo mặc định. Điều này ngăn Googlebot hiển thị trang đúng cách và hiểu rằng trang web của bạn được tối ưu hóa cho thiết bị di động.
  • Bạn cũng có thể sử dụng file robots.txt để ngăn các trang cụ thể không được lập chỉ mục, như đăng nhập hoặc trang 404, nhưng điều này được thực hiện tốt hơn bằng cách sử dụng thẻ meta của robot.
  • Việc thêm các câu lệnh không được phép vào tệp robot.txt sẽ không xóa nội dung. Nó chỉ đơn giản là chặn truy cập của trình crawl. Nếu có nội dung mà bạn không muốn hiển thị, tốt hơn là sử dụng meta noindex.
  • Theo quy định, không bao giờ sử dụng tệp robot.txt để xử lý nội dung trùng lặp. Có nhiều cách tốt hơn như thẻ Rel = canonical.

4. Robots.txt cho WordPress

- WordPress tạo tệp robot.txt ảo khi bạn xuất bản bài đăng đầu tiên của mình với WordPress. Và nếu bạn đã có tệp robot.txt thực sự được tạo trên máy chủ của mình, WordPress sẽ không thêm tệp ảo.

- Robots.txt ảo không tồn tại trên máy chủ và bạn chỉ có thể truy cập thông qua liên kết sau: http://www.your site.com/robots.txt

- Theo mặc định, nó sẽ được phép Mediabot của Google, một loạt spam không được phép và một số thư mục và tệp WordPress tiêu chuẩn không được phép. 

- Vì vậy, trong trường hợp bạn chưa tạo robot.txt thực sự, hãy tạo một tệp bằng bất kỳ trình soạn thảo văn bản nào và tải nó lên thư mục gốc của máy chủ của bạn qua FTP. 

* Chặn các thư mục WordPress chính:

- Có 3 thư mục chuẩn trong mỗi lần cài đặt WordPress -wp-content, wp-admin, wp-include không cần lập chỉ mục. 

- Tuy nhiên, đừng chọn disallow toàn bộ thư mục nội dung wp, vì nó chứa thư mục con 'upload' với các tệp phương tiện của trang web của bạn mà bạn không muốn bị chặn. Đó là lý do tại sao bạn cần phải tiến hành như sau:

  • Disallow: / wp-admin / 
  • Disallow: / wp-includes /
  • Disallow: / wp-content / plugins / 
  • Disallow: / wp-content / themes / 
* Chặn trên cơ sở cấu trúc trang web của bạn

- Mỗi blog có thể được cấu trúc theo nhiều cách khác nhau:

  •  a) Trên cơ sở các danh mục 
  •  b) Trên cơ sở các thẻ 
  •  c) Trên cơ sở cả hai - không ai trong số đó 
  •  d) Trên cơ sở lưu trữ dựa trên ngày 

- Cụ thể:

a) Nếu trang web của bạn có cấu trúc danh mục, bạn không cần phải lưu trữ Thẻ được lập chỉ mục.Tìm cơ sở thẻ của bạn trong trang tùy chọn Permalinks trong menu Cài đặt . Nếu trường được để trống, cơ sở thẻ chỉ đơn giản là 'tag': 

 

   Disallow: / tag / 

b) Nếu trang web của bạn có cấu trúc thẻ, bạn cần chặn lưu trữ danh mục. Tìm cơ sở danh mục của bạn và sử dụng chỉ thị sau: 

 

   Disallow: / category / 

c) Nếu bạn sử dụng cả danh mục và thẻ, bạn không cần sử dụng bất kỳ chỉ thị nào. Trong trường hợp bạn không sử dụng bất kỳ ứng dụng nào trong số đó, bạn cần chặn cả hai: 

    Disallow: / tags / 

    Disallow: / category / 

 

d) Nếu trang web của bạn được cấu trúc trên cơ sở lưu trữ dựa trên ngày, bạn có thể chặn những trang đó theo các cách sau: 

  Disallow: / 2010 / 

  Disallow: / 2011 / 

  Disallow: / 2012 / 

  Disallow: / 2013 / 

 

LƯU Ý: Bạn không thể sử dụng Disallow: / 20 * / ở đây vì một lệnh như vậy sẽ chặn mọi bài đăng trên blog hoặc trang bắt đầu bằng số '20'. 

* Các vấn đề trùng lặp nội dung trong WordPress

Theo mặc định, WordPress có các trang trùng lặp không tốt cho thứ hạng SEO của bạn. Để sửa chữa nó, chúng tôi khuyên bạn không nên sử dụng robot.txt mà thay vào đó hãy sử dụng cách tinh vi hơn: thẻ 'rel = canonical' mà bạn sử dụng để đặt URL chính xác duy nhất trong phần trang web của bạn. Bằng cách này, trình thu thập dữ liệu web sẽ chỉ thu thập thông tin phiên bản chính tắc của một trang.

4. Cuối cùng:

Trên đây là bài viết của mình về "Hướng dẫn sử dụng file Robots.txt và cài đặt Robotsl.txt cho WordPress". Nếu có chỗ nào chưa hiểu các bạn có thể cmt xuống phía dưới để mình giải đáp.