robots txt 에 의해 차단됨 오류 해결 방법 5가지

오쿨스

robots txt 에 의해 차단됨 오류는 검색 엔진 크롤러가 웹사이트 접근을 제한할 때 발생합니다. robots.txt 설정 확인, 서치콘솔 활용, 사이트맵 제출 등 해결 방법을 안내합니다.

robots txt 역할과 차단 오류 원인

robots.txt 파일 개념과 기능

robots txt 파일은 검색 엔진 크롤러의 접근을 제어하는 규칙을 정의하는 텍스트 파일입니다. 웹사이트의 루트 디렉토리(/robots.txt)에 위치하며, 크롤러가 특정 페이지를 크롤링할 수 있는지 여부를 결정합니다.

robots txt 파일의 주요 기능은 다음과 같습니다.

기능설명
크롤러 접근 제어검색 엔진 크롤러가 특정 페이지를 크롤링하는 것을 허용하거나 차단할 수 있습니다.
서버 부하 관리불필요한 크롤링을 제한하여 서버 리소스를 절약할 수 있습니다.
SEO 최적화중복 콘텐츠나 민감한 정보를 검색 결과에서 제외할 수 있습니다.

검색 엔진 크롤러 차단 원인

robots txt 차단 오류가 발생하는 이유는 여러 가지가 있습니다. 주요 원인은 다음과 같습니다.

1. 잘못된 Disallow 규칙

robots txt 파일에서 특정 디렉토리를 차단하는 Disallow 규칙이 잘못 설정된 경우 크롤러가 페이지에 접근할 수 없습니다. 예를 들어, 전체 사이트가 차단된 경우는 다음과 같습니다.

User-agent: *
Disallow: /

이 경우 모든 검색 엔진이 사이트를 크롤링할 수 없으므로, 수정이 필요합니다.

2. 파일 위치 오류

robots txt 파일은 반드시 웹사이트 루트 디렉토리에 위치해야 합니다. 예를 들어, 다음 URL에서 접근할 수 있어야 합니다.

https://www.example.com/robots.txt

파일이 다른 위치에 저장되었거나, 서버 설정 문제로 인해 접근할 수 없는 경우 차단 오류가 발생할 수 있습니다.

3. 특정 페이지 또는 플랫폼 설정

일부 웹사이트 플랫폼(예: 티스토리, 네이버 블로그)에서는 기본적으로 특정 페이지(관리자 페이지, 로그인 페이지 등)를 차단하도록 설정되어 있습니다. 예를 들어, 다음과 같은 설정이 있을 수 있습니다.

User-agent: *
Disallow: /admin/
Disallow: /login/

이 경우, 중요한 페이지가 차단되지 않도록 설정을 수정해야 합니다.

4. 크롤러 예외 설정

일부 웹사이트는 특정 검색 엔진의 크롤러만 허용하고, 다른 크롤러는 차단할 수 있습니다. 예를 들어, Googlebot만 허용하는 경우 다음과 같은 설정이 가능합니다.

User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /

이 경우, Googlebot 외의 크롤러는 웹사이트를 크롤링할 수 없습니다.

robots txt 파일 확인 및 수정 방법

robots txt 파일 위치 및 접근 확인

robots txt 파일은 웹사이트 루트 디렉토리에 위치해야 하며, 다음 URL을 통해 직접 접근하여 내용을 확인할 수 있습니다.

https://www.example.com/robots.txt

파일이 존재하지 않거나, 서버 설정 문제로 인해 접근이 불가능한 경우 robots txt 차단 오류가 발생할 수 있습니다. 이를 해결하기 위해 웹 브라우저에서 직접 URL을 입력하거나, 구글 서치콘솔에서 ‘robots.txt 테스터’를 이용하여 파일을 확인해야 합니다.

Disallow, Allow 설정 방법

robots txt 파일의 핵심 규칙은 User-agent, Disallow, Allow 지시문입니다. 각각의 역할은 다음과 같습니다.

지시문설명
User-agent검색 엔진 크롤러를 지정합니다. 예: User-agent: Googlebot
Disallow차단할 경로를 지정합니다. 예: Disallow: /private/
Allow특정 경로에 대한 크롤링을 허용합니다. 예: Allow: /public/

robots txt 파일 수정 방법

robots txt 차단 문제를 해결하려면, 다음과 같은 수정이 필요할 수 있습니다.

1. 모든 검색 엔진 크롤링 허용

웹사이트 전체를 검색 엔진에 노출하려면 다음과 같이 설정해야 합니다.

User-agent: *
Allow: /

2. 특정 페이지 차단

관리자 페이지 또는 비공개 데이터를 차단하려면 다음과 같이 설정할 수 있습니다.

User-agent: *
Disallow: /admin/
Disallow: /private/

3. 특정 검색 엔진만 허용

Googlebot은 허용하고, 다른 크롤러는 차단하려면 다음과 같이 설정합니다.

User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /

robots txt 파일을 수정한 후에는 반드시 구글 서치콘솔에서 ‘robots.txt 테스터’를 이용하여 변경 사항이 올바르게 적용되었는지 확인해야 합니다.

구글 서치콘솔을 활용한 문제 해결

URL 검사 도구 활용

robots txt 차단 오류가 발생한 경우, 구글 서치콘솔의 ‘URL 검사 도구’를 사용하여 문제를 진단할 수 있습니다. URL 검사 도구는 특정 페이지가 검색 엔진에 색인될 수 있는지 확인하는 기능을 제공합니다.

URL 검사 도구를 사용하는 방법은 다음과 같습니다.

  1. 구글 서치콘솔에 접속하여 사이트를 선택합니다.
  2. 상단 검색창에 문제가 발생한 URL을 입력하고 Enter를 누릅니다.
  3. ‘페이지 색인 생성’ 섹션에서 상태를 확인합니다.

만약 ‘robots.txt에 의해 차단됨’이라는 메시지가 표시되면, 해당 페이지가 크롤러에 의해 접근이 제한된 상태라는 의미입니다.

robots.txt 테스터 사용법

구글 서치콘솔에서는 robots.txt 파일이 올바르게 설정되었는지 확인할 수 있는 ‘robots.txt 테스터’ 도구를 제공합니다. 이를 통해 특정 크롤러가 웹사이트를 크롤링할 수 있는지 즉시 테스트할 수 있습니다.

robots.txt 테스터를 사용하려면 다음 단계를 따릅니다.

  1. 구글 서치콘솔에서 ‘설정’ 메뉴를 클릭합니다.
  2. ‘크롤링 및 색인’ 섹션에서 ‘robots.txt 테스터’를 선택합니다.
  3. 현재 적용된 robots.txt 파일의 내용을 확인하고 필요한 경우 수정합니다.
  4. 테스트할 URL을 입력한 후 ‘테스트’ 버튼을 클릭합니다.

테스트 결과 크롤링이 차단된 것으로 나오면, robots.txt 파일을 수정한 후 다시 테스트해야 합니다.

robots txt 수정 후 색인 요청

robots txt 파일을 수정한 후에도 검색 엔진이 변경 사항을 즉시 반영하지 않을 수 있습니다. 이 경우, ‘색인 요청’ 기능을 활용하여 구글 크롤러가 페이지를 다시 크롤링하도록 요청할 수 있습니다.

색인 요청을 하려면 다음 단계를 따릅니다.

  1. 구글 서치콘솔에서 ‘URL 검사 도구’를 엽니다.
  2. 검사할 URL을 입력한 후 Enter를 누릅니다.
  3. ‘색인 생성 요청’ 버튼을 클릭합니다.

색인 요청 후 크롤러가 사이트를 다시 방문하는 데는 일정 시간이 걸릴 수 있습니다. 빠른 반영을 위해 사이트맵을 업데이트하는 것도 좋은 방법입니다.

사이트맵 제출과 색인 요청 방법

서치콘솔에서 사이트맵 제출하는 방법

robots txt 차단 오류를 해결한 후, 검색 엔진이 웹사이트를 빠르게 인식하도록 사이트맵을 제출해야 합니다. 사이트맵은 웹사이트의 모든 중요한 페이지 목록을 포함하는 XML 파일로, 검색 엔진이 사이트 구조를 효율적으로 크롤링할 수 있도록 도와줍니다.

구글 서치콘솔에서 사이트맵을 제출하는 방법은 다음과 같습니다.

  1. 구글 서치콘솔에 로그인합니다.
  2. 왼쪽 메뉴에서 ‘사이트맵’ 섹션을 선택합니다.
  3. ‘새 사이트맵 추가’ 입력란에 사이트맵 URL을 입력합니다. (예: https://www.example.com/sitemap.xml)
  4. ‘제출’ 버튼을 클릭하여 사이트맵을 제출합니다.

사이트맵 제출 후에는 검색 엔진이 이를 분석하고 색인할 때까지 시간이 걸릴 수 있습니다. 이후 ‘사이트맵’ 섹션에서 처리 상태를 확인할 수 있습니다.

색인 요청을 통한 크롤링 촉진

robots txt 차단 문제를 해결하고 사이트맵을 제출한 후, 특정 페이지가 신속하게 검색 결과에 반영되도록 색인 요청을 할 수 있습니다. 구글 서치콘솔의 ‘URL 검사 도구’를 활용하면 크롤링을 촉진할 수 있습니다.

색인 요청 방법은 다음과 같습니다.

  1. 구글 서치콘솔에서 ‘URL 검사 도구’를 엽니다.
  2. 검사할 URL을 입력하고 Enter를 누릅니다.
  3. 페이지 상태를 확인한 후 ‘색인 생성 요청’ 버튼을 클릭합니다.

색인 요청을 하면 구글 크롤러가 해당 페이지를 다시 방문하여 업데이트된 내용을 반영합니다. 다만, 요청 후 즉시 반영되지 않을 수도 있으며, 크롤링 빈도와 사이트 상태에 따라 시간이 소요될 수 있습니다.

사이트맵과 robots txt 연관성

robots txt와 사이트맵은 함께 사용하여 검색 엔진 최적화를 도울 수 있습니다. 사이트맵은 검색 엔진이 중요한 페이지를 더 빠르게 찾을 수 있도록 하고, robots txt는 불필요한 페이지 크롤링을 차단하여 크롤링 예산을 효율적으로 관리하는 역할을 합니다.

robots txt 파일에서 사이트맵을 명시적으로 지정할 수도 있습니다.

User-agent: *
Allow: /
Sitemap: https://www.example.com/sitemap.xml

이 설정을 추가하면 검색 엔진이 사이트맵을 자동으로 찾아 색인 생성에 활용할 수 있습니다.

robots txt 에 의해 차단됨

플랫폼별 robots txt 에 의해 차단됨 문제 해결

티스토리 robots txt 설정 방법

티스토리는 기본적으로 robots txt 파일을 직접 수정할 수 없으며, 특정 페이지가 검색 엔진에 노출되지 않도록 설정될 수 있습니다. 특히, ‘방명록’과 같은 페이지는 기본적으로 검색 차단 설정이 적용될 수 있습니다.

티스토리에서 robots txt 차단 문제를 해결하는 방법은 다음과 같습니다.

  1. 티스토리 관리자 페이지에 접속합니다.
  2. ‘관리’ 메뉴에서 ‘검색엔진 최적화(SEO)’ 설정을 확인합니다.
  3. ‘검색 엔진 크롤링 허용’ 옵션이 활성화되어 있는지 확인합니다.
  4. 방명록이 검색 엔진에 차단되지 않도록 ‘로그인 사용자만 허용’ 설정을 변경합니다.

추가적으로, 구글 서치콘솔에서 사이트맵을 제출하고 색인 요청을 하면 크롤링 속도를 높일 수 있습니다.

워드프레스 robots txt 설정 방법

워드프레스는 robots txt 파일을 직접 수정할 수 있으며, 플러그인을 활용하면 손쉽게 설정을 변경할 수 있습니다. 기본적으로 ‘읽기 설정’에서 검색 엔진 차단 여부를 확인할 수 있습니다.

robots txt 설정을 변경하는 방법은 다음과 같습니다.

  1. 워드프레스 관리자 페이지에서 ‘설정 → 읽기’로 이동합니다.
  2. ‘검색 엔진이 이 사이트를 크롤링하지 못하도록 합니다’ 옵션이 체크되어 있으면 해제합니다.
  3. Yoast SEO 또는 Rank Math 플러그인을 설치하여 robots txt 파일을 수정할 수 있습니다.
  4. 플러그인에서 robots txt 파일을 다음과 같이 설정합니다.
User-agent: *
Allow: /
Sitemap: https://www.example.com/sitemap.xml

이 설정을 적용하면 검색 엔진이 사이트를 정상적으로 크롤링할 수 있습니다.

네이버 블로그 robots txt 문제 해결

네이버 블로그는 robots txt 파일을 직접 수정할 수 없으며, 검색 노출을 위해서는 네이버 서치어드바이저를 활용해야 합니다.

네이버 블로그의 검색 차단 문제를 해결하는 방법은 다음과 같습니다.

  1. 네이버 서치어드바이저에 접속하여 블로그를 등록합니다.
  2. ‘사이트 최적화’ 메뉴에서 검색 색인 상태를 확인합니다.
  3. 사이트맵 제출 기능을 활용하여 네이버 검색 엔진이 블로그를 빠르게 색인할 수 있도록 요청합니다.

네이버 블로그의 경우 검색 반영까지 시간이 걸릴 수 있으므로, 꾸준히 SEO 설정을 최적화하는 것이 중요합니다.

웹 호스팅 환경에서 robots txt 수정

자체 호스팅 웹사이트에서는 FTP 또는 파일 관리자를 통해 robots txt 파일을 직접 수정할 수 있습니다. 파일이 올바르게 설정되지 않으면 검색 엔진이 페이지를 색인하지 못할 수 있습니다.

robots txt 파일을 수정하는 방법은 다음과 같습니다.

  1. 웹 호스팅 계정에 FTP 또는 파일 관리자로 접속합니다.
  2. 웹사이트 루트 디렉토리에서 robots.txt 파일을 찾습니다.
  3. 다음과 같이 수정하여 검색 엔진 크롤링을 허용합니다.
User-agent: *
Allow: /
Sitemap: https://www.example.com/sitemap.xml

수정 후 구글 서치콘솔에서 ‘robots.txt 테스터’를 사용하여 변경 사항이 정상적으로 반영되었는지 확인해야 합니다.