Частотный анализ текста: частотность слов, водность и тошнота
Частотность слова в тексте и частотность запроса — разные вещи. Разбираем плотность ключей, водность и классическую тошноту на примерах.
У каждого автора есть слово-костыль. У меня это долго было «действительно» — однажды я нашёл его одиннадцать раз в статье на 900 слов и не помнил, чтобы напечатал его хоть раз. Свои повторы не замечаешь: мозг проскакивает мимо них на автомате. Частотный подсчёт замечает за вас.
Частотность слов берёт вставленный текст и выдаёт таблицу всех слов, отсортированную по числу повторов, с процентом от общего объёма. Вот и весь инструмент. Что делать с таблицей — зависит от того, зачем вы её открыли.
Сначала — какая именно «частотность»
В русском SEO одним словом называют две несовместимые вещи, и половина людей, ищущих «проверить частотность ключевых слов», приходит не туда.
Частотность запроса — сколько раз фразу вводили в поиске за месяц. Это данные самого поисковика; смотрят их в Яндекс Вордстате, и ни один анализатор текста их не знает, потому что знать не может.
Частотность слова в тексте — сколько раз слово встречается в конкретном документе. Это чистая арифметика по вашему тексту, и именно её считает инструмент, о котором эта статья.
Правило простое: собираете семантику — идите в Вордстат; проверяете уже написанный текст на повторы и переспам — оставайтесь здесь.
Редактура собственного текста
Отсортируйте черновик на 1500 слов по частоте — верх списка предсказуем: «и», «в», «на», «что». Их пропускаем. Интересное начинается примерно с десятой позиции, где появляются содержательные слова. Если «решение» встречается на странице продукта 14 раз, читатель почувствовал каждое.
Моё грубое правило: любое содержательное слово с долей выше 1% заслуживает проверки. Это одно вхождение на сто слов — часто нормально, иногда навязчиво. Колонка с процентами превращает проверку в пятисекундное дело.
Поставьте минимальную длину слова 4–5, чтобы скрыть предлоги и союзы и сразу увидеть лексику, которая несёт смысл.
Проверка плотности ключевых слов для SEO
Плотность ключевых слов — долю текста, приходящуюся на целевой запрос, — когда-то накручивали без стеснения. В 2005 году страницы, где ключ занимал 8% текста, спокойно ранжировались. Обновление Google Panda в 2011-м это закрыло, и сегодня переспам скорее вредит.
Но как быстрая проверка плотность всё ещё полезна, причём в обе стороны:
- Ключ занимает 4% и больше — страница, скорее всего, читается как написанная для робота. Переписывайте.
- Ключ встретился один раз на 2000 слов — поисковик может вообще не связать страницу с запросом.
Большинство SEO-авторов держатся в диапазоне 0,5–2%. Магического числа нет, но счётчик хотя бы показывает, где вы находитесь, вместо гадания.
Анализ чужих текстов
Частотный анализ старше SEO на несколько веков. Им спорили об авторстве пьес Шекспира, а стилометрия — атрибуция по частотам употребления слов — в 2013 году помогла раскрыть Джоан Роулинг за псевдонимом Роберт Гэлбрейт. Частоты служебных слов оказались отпечатком пальца: никто не употребляет «впрочем» с той же частотой, что и вы.
Романистов вы вряд ли разоблачаете, но идея работает и в малом масштабе. Студенты составляют частотный словарь иностранного текста перед чтением. Преподаватели прогоняют сочинения через счётчик и видят, не сменился ли вдруг словарный запас студента между работами. Исследователи начинают с него контент-анализ: сначала посчитать, потом интерпретировать.
Водность и тошнота: две цифры, которые у нас спрашивают
Русские сервисы вроде Advego и text.ru приучили всех к двум показателям, и оба считаются прямо над таблицей.
Водность — доля служебных слов от всех слов текста: предлоги, союзы, местоимения, частицы, вводные. Формула в одну строку, но подвох в списке: у каждого сервиса он свой. У нас около 250 русских и английских служебных слов, у Advego список заметно шире, поэтому их процент и наш — разные шкалы. Сравнивать нужно свои тексты между собой, а не наше число с чужим нормативом. По нашему списку русские статьи обычно дают 22–28%, английские — 33–43%: в английском артикли и вспомогательные глаголы обязательны там, где русский обходится падежом.
Классическая тошнота — квадратный корень из числа повторов самого частого слова. Определение Advego, и смысл у него специфический: показатель не падает при росте объёма. Шестнадцать повторов дают 4,00 и в заметке на 500 слов, и в книге на 300 страниц. Поэтому его смотрят не вместо плотности, а рядом с ней. Ориентир — не выше 7, то есть не больше 49 повторов одного слова.
Академическая тошнота — доля самого частого значимого слова среди значимых. Включите «Скрыть служебные слова», и процент в первой строке таблицы и будет ей. Единой формулы у сервисов нет, так что публикуемые нормы вроде «5–15%» переносить между инструментами нельзя.
Словосочетания считаются отдельно
Частотный счётчик работает с отдельными словами. Между тем ключ почти всегда состоит из двух-трёх слов, и по отдельности его части ничего не говорят: «частотность» и «слов» в верхних строках таблицы не значат, что фраза «частотность слов» вообще встречается в тексте подряд.
Для биграмм и триграмм нужен другой инструмент — проверка плотности ключевых слов считает сочетания из двух и трёх слов и отдельно оценивает один целевой ключ. Порядок работы обычно такой: сначала частотность слов, чтобы увидеть словарь и повторы, потом плотность сочетаний, чтобы проверить сам ключ.
Что счётчик считает словом
Любую последовательность букв или цифр, так что «кто-то» и «во-первых» считаются одним словом, а не обломками. Знаки препинания отбрасываются. Кириллица, диакритика и иероглифы работают: инструмент делит текст по категориям Юникода, а не в расчёте на английский.
Правило чуть отличается от обычного счётчика слов, который делит текст только по пробелам. На связном тексте итоги совпадают, но расходятся там, где много знаков: одиночное тире там слово, а здесь нет. Если нужен просто объём — в знаках, страницах или авторских листах — быстрее взять его.
Регистр по умолчанию не учитывается — «Текст» и «текст» складываются вместе. Включите учёт регистра, если важно отделить имена собственные от нарицательных.
Чего счётчик не делает — так это не приводит слова к начальной форме. «Ключ», «ключа» и «ключом» останутся тремя строками. Это сознательный отказ: морфологический разбор русского требует словаря, спотыкается на омонимах вроде «стекло» и превращает проверяемую арифметику в чёрный ящик. Практический обход — поставить минимальную длину слова 4–5 и читать словоформы одного корня группой.
Всё работает в браузере. Текст не отправляется ни на какой сервер, поэтому вставлять неопубликованную рукопись или конфиденциальный отчёт безопасно.
Вставьте что-нибудь в Частотность слов и посмотрите на верх своего списка — слово-костыль у вас уже есть, вы просто ещё с ним не знакомы. Если таблицу нужно унести дальше, кнопка «Скачать CSV» отдаёт её в UTF-8 с BOM, и Excel открывает кириллицу без кракозябр.