Короткий ответ
Страница-сирота (orphan page) — это страница сайта, на которую не ведёт ни одной внутренней ссылки. Открыть её можно только по прямому URL или найти в sitemap, но ни пользователь, перемещаясь по сайту, ни краулер, идущий по ссылкам, до неё не доберутся.
Опасность не в санкциях — их за это нет. Опасность в том, что такая страница не получает внутреннего веса, обходится Googlebot редко и обновления на ней замечаются с большой задержкой. Найти сирот одним краулером невозможно по определению: нужно сравнить обход по ссылкам со списками URL из sitemap, Search Console, логов и аналитики.
Чем сирота отличается от других проблемных страниц
Термин часто смешивают с соседними, а лечатся они по-разному.
| Тип страницы | Что с ней не так | Код ответа |
|---|---|---|
| Страница-сирота | Нет ни одной входящей внутренней ссылки | 200 |
| Битая страница | Не существует, ссылки на неё ведут в никуда | 404 / 410 |
| Страница глубокого уровня | Ссылки есть, но до неё 5+ кликов от главной | 200 |
| Страница вне индекса | Ссылки есть, но она закрыта noindex или canonical | 200 |
| Тупиковая страница (dead end) | На неё ссылаются, но с неё нет исходящих ссылок | 200 |
Практическая разница: битая страница видна в любом отчёте об ошибках, а сирота выглядит абсолютно здоровой. Она отдаёт 200, у неё нормальный title, она может даже приносить трафик — просто в разы меньше, чем могла бы. Именно поэтому сироты живут на сайтах годами.
Отдельно стоит развести сироту и страницу с одной входящей ссылкой из футера. Формально вторая не сирота, но по количеству получаемого веса разница между ними невелика — об этом я подробно писал в статье про внутреннюю перелинковку сайта.
Почему сироты — это плохо
Три эффекта, и они разного размера.
Страница почти не получает внутреннего веса. Вес приходит на сайт по внешним ссылкам и расходится по внутренним. Страница без входящих ссылок стоит вне этого потока: у неё есть только то, что она может получить напрямую извне, а на типичной странице услуги или карточке товара внешних ссылок нет вовсе.
Краулер приходит редко. Googlebot обходит сайт по ссылкам, а sitemap использует как список кандидатов. По моим наблюдениям, страницы без входящих ссылок переобходятся заметно реже остальных: правки на них Google замечает с задержкой в недели, а не в дни. На небольшом сайте это терпимо, на каталоге в десятки тысяч URL — уже вопрос краулингового бюджета.
Мусор попадает в индекс незаметно. Обратная сторона: сироты бывают не только полезными. Тестовые копии страниц, старые версии посадочных, страницы вложений WordPress, архивы по тегам — всё это часто существует именно как сироты. Их никто не видит в структуре, поэтому никто и не замечает, что они индексируются.
Четвёртый эффект — организационный, но самый неприятный. Страница-сирота обычно означает, что кто-то потратил время на её создание, а потом она выпала из структуры. То есть это уже оплаченная работа, которая не приносит результата.
Как найти страницы-сироты: пять источников
Ключевая мысль: краулер один не справится. Screaming Frog, Sitebulb или мой собственный краулер идут по ссылкам — страница без входящих ссылок для них не существует. Нужна сверка нескольких списков URL.
- Обход сайта по ссылкам. Стартуете с главной, краулер собирает всё, до чего дошёл. Это ваш «список связанных страниц» — база для сравнения.
- Sitemap.xml. Загружаете отдельно и сравниваете с обходом. Всё, что есть в sitemap, но не найдено краулером, — прямой кандидат в сироты. Это самый быстрый способ, но он видит только то, что CMS сама положила в sitemap.
- Отчёт «Индексирование страниц» в Search Console. Экспортируете список известных Google URL. Здесь всплывают страницы, о которых не знает ни sitemap, ни краулер, — например, старые URL, на которые где-то остались внешние ссылки.
- Логи сервера. Самый полный источник: показывает все URL, к которым реально обращался Googlebot. На больших сайтах это единственный способ увидеть картину целиком, но и работы с ним больше.
- GA4 и отчёт по посадочным страницам. Показывает URL, на которые реально приходили люди. Если страница приносит трафик, но не найдена краулером — это сирота, причём ценная.
Дальше вся работа сводится к операции «вычитание списков»: URL из источников 2–5 минус URL из обхода = кандидаты. Именно кандидаты, а не готовый диагноз: часть отсеется на проверке.
Что отсеять сразу, чтобы не тратить время:
- URL с параметрами (
?utm_source=,?sort=), если они склеены canonical; - страницы, закрытые в robots.txt — краулер их не обошёл не потому, что нет ссылок;
- пагинация и фильтры, если они генерируются скриптом и краулер не исполнял JavaScript;
- страницы, ссылки на которые стоят в блоках, подгружаемых через JS. Это отдельная и частая история: ссылка в разметке есть, но краулер без рендеринга её не видит, и страница выглядит сиротой, не будучи ею.
Последний пункт стоит проверять всегда, прежде чем что-то чинить: половина «сирот» на сайтах со сложным фронтендом — это ложные срабатывания краулера без исполнения JavaScript.
Откуда сироты берутся
| Источник | Как это выглядит | Что обычно нужно делать |
|---|---|---|
| Миграция сайта | Часть URL перенесли, ссылки на них не восстановили | Вернуть в структуру или склеить 301 |
| Чистка каталога | Категорию убрали из меню, карточки товаров остались | Решить судьбу карточек: перенести или закрыть |
| Посадочные под рекламу | Страницы намеренно не в навигации | Оставить как есть, но убрать из индекса |
| Автогенерация CMS | Архивы по датам, тегам, авторам, вложения WordPress | Закрыть noindex, убрать из sitemap |
| Старые акции и лендинги | Кампания закончилась, ссылки сняли, страница осталась | 410 или редирект на актуальный раздел |
| Импорт товаров | Товары загрузили в базу, но не привязали к категории | Привязать к категории |
| Ручные правки шаблона | Ссылку убрали из блока при редизайне | Вернуть ссылку |
Отдельно про посадочные страницы под Google Ads. Их часто специально держат вне навигации — и это нормально, если страница закрыта от индексации. Проблема начинается, когда рекламная посадочная индексируется и начинает конкурировать с основной страницей услуги за один и тот же запрос. Тогда к сиротству добавляется каннибализация запросов, и разбираться приходится уже с двумя проблемами сразу.
Что делать с найденными сиротами
Порядок важен: сначала решение о судьбе страницы, потом ссылки. Обратный порядок приводит к тому, что вы старательно перелинковываете страницы, которых на сайте быть не должно.
- Отсортируйте кандидатов по ценности. Есть ли у страницы показы в Search Console, приходил ли на неё трафик, есть ли внешние ссылки. Страница с показами — точно не мусор.
- Ответьте на вопрос: у страницы есть свой кластер запросов? Если да — она нужна. Если она отвечает тому же интенту, что и другая страница, — это дубль.
- Нужные страницы встройте в структуру. Пункт в нужной категории, контекстные ссылки из 2–3 релевантных материалов, если уместно — место в меню. Ориентир по глубине: не больше трёх кликов от главной.
- Дубли склейте. 301 на основную страницу, если контент действительно тот же; canonical, если обе версии зачем-то нужны.
- Мусор уберите. Страницы, которых не должно быть в индексе, —
noindexи вон из sitemap; страницы, которых не должно быть вовсе, — 410. Ставитьnoindexи одновременно оставлять URL в sitemap не нужно: вы отправляете Google противоречивые сигналы. - Проверьте, не повторится ли это. Если сироты появились из-за шаблона или импорта, поштучная правка ничего не решает — чинить нужно источник.
Шаг 3 стоит делать не по одной странице, а сразу пакетом: если из структуры выпали 40 карточек одной категории, чинится это одним изменением шаблона категории, а не сорока правками.
Что я вижу на своих проектах
Цифру «сироты дают +N% трафика» я не назову — её не существует, и любая конкретика здесь была бы выдуманной. Но закономерности повторяются.
Сироты почти всегда появляются пачками, а не по одной. Если нашли одну — ищите остальные из той же партии: обычно у них общий источник, будь то миграция или импорт. Поштучная правка в такой ситуации — худший вариант расхода времени.
Больше половины найденных сирот на типичном сайте оказываются мусором. Архивы тегов, страницы вложений, тестовые копии. Это не разочарование, а нормальный результат: чистка индекса от них полезнее, чем перелинковка пары забытых статей.
Ценные сироты чаще всего находятся среди старого контента. Статья, которая была в блоге три редизайна назад, до сих пор собирает показы — просто на неё уже никто не ссылается. Такие страницы дают самый быстрый эффект от возврата в структуру, потому что у них уже есть история в индексе.
Про границы применимости. На сайте из 20 страниц вся эта методика избыточна: там достаточно просмотреть карту сайта глазами. Она начинает окупаться примерно от сотни URL, а на каталоге в десятки тысяч становится обязательной регулярной процедурой. И ещё: возврат сироты в структуру не сделает страницу релевантной, если она изначально не отвечает интенту. Перелинковка усиливает то, что работает, а не создаёт смысл с нуля — если структура сайта собрана не под спрос, начинать надо с неё.
Самый честный тест на сироту: попробуйте дойти до страницы с главной, пользуясь только ссылками. Если не получилось за пять минут — у Google тоже не получится.
Чек-лист: разбор сирот за один заход
- Прокраульте сайт с главной страницы, с исполнением JavaScript, если фронтенд на нём построен.
- Выгрузите sitemap.xml и сравните со списком найденных URL.
- Экспортируйте отчёт «Индексирование страниц» из Search Console и добавьте к сравнению.
- Возьмите посадочные страницы из GA4 за последние 12 месяцев — они покажут ценные сироты.
- Вычтите из объединённого списка всё, что нашёл краулер по ссылкам.
- Отсейте ложные срабатывания: robots.txt, параметры, ссылки в JS-блоках.
- Разделите остаток на «нужное» и «мусор» по наличию своего кластера запросов.
- Нужное встройте в структуру — категорией, меню, контекстными ссылками.
- Мусор закройте noindex или отдайте 410 и уберите из sitemap.
- Найдите общий источник партии сирот и почините его, а не только следствия.
- Повторите проверку через квартал — и обязательно после любой миграции или редизайна.
Если после этого выяснится, что сироты появляются снова после каждого обновления каталога, вопрос уже не в SEO, а в том, как устроена генерация страниц: это веб-разработка, и решается она на уровне шаблонов, а не ручной перелинковки.
