belun.app Блог
EN
· обновлено

Частотный анализ текста: частотность слов, водность и тошнота

Частотность слова в тексте и частотность запроса — разные вещи. Разбираем плотность ключей, водность и классическую тошноту на примерах.

Лупа над страницами открытой книги для анализа частотности слов

У каждого автора есть слово-костыль. У меня это долго было «действительно» — однажды я нашёл его одиннадцать раз в статье на 900 слов и не помнил, чтобы напечатал его хоть раз. Свои повторы не замечаешь: мозг проскакивает мимо них на автомате. Частотный подсчёт замечает за вас.

Частотность слов берёт вставленный текст и выдаёт таблицу всех слов, отсортированную по числу повторов, с процентом от общего объёма. Вот и весь инструмент. Что делать с таблицей — зависит от того, зачем вы её открыли.

Сначала — какая именно «частотность»

В русском SEO одним словом называют две несовместимые вещи, и половина людей, ищущих «проверить частотность ключевых слов», приходит не туда.

Частотность запроса — сколько раз фразу вводили в поиске за месяц. Это данные самого поисковика; смотрят их в Яндекс Вордстате, и ни один анализатор текста их не знает, потому что знать не может.

Частотность слова в тексте — сколько раз слово встречается в конкретном документе. Это чистая арифметика по вашему тексту, и именно её считает инструмент, о котором эта статья.

Правило простое: собираете семантику — идите в Вордстат; проверяете уже написанный текст на повторы и переспам — оставайтесь здесь.

Редактура собственного текста

Отсортируйте черновик на 1500 слов по частоте — верх списка предсказуем: «и», «в», «на», «что». Их пропускаем. Интересное начинается примерно с десятой позиции, где появляются содержательные слова. Если «решение» встречается на странице продукта 14 раз, читатель почувствовал каждое.

Моё грубое правило: любое содержательное слово с долей выше 1% заслуживает проверки. Это одно вхождение на сто слов — часто нормально, иногда навязчиво. Колонка с процентами превращает проверку в пятисекундное дело.

Поставьте минимальную длину слова 4–5, чтобы скрыть предлоги и союзы и сразу увидеть лексику, которая несёт смысл.

Проверка плотности ключевых слов для SEO

Плотность ключевых слов — долю текста, приходящуюся на целевой запрос, — когда-то накручивали без стеснения. В 2005 году страницы, где ключ занимал 8% текста, спокойно ранжировались. Обновление Google Panda в 2011-м это закрыло, и сегодня переспам скорее вредит.

Но как быстрая проверка плотность всё ещё полезна, причём в обе стороны:

  • Ключ занимает 4% и больше — страница, скорее всего, читается как написанная для робота. Переписывайте.
  • Ключ встретился один раз на 2000 слов — поисковик может вообще не связать страницу с запросом.

Большинство SEO-авторов держатся в диапазоне 0,5–2%. Магического числа нет, но счётчик хотя бы показывает, где вы находитесь, вместо гадания.

Анализ чужих текстов

Частотный анализ старше SEO на несколько веков. Им спорили об авторстве пьес Шекспира, а стилометрия — атрибуция по частотам употребления слов — в 2013 году помогла раскрыть Джоан Роулинг за псевдонимом Роберт Гэлбрейт. Частоты служебных слов оказались отпечатком пальца: никто не употребляет «впрочем» с той же частотой, что и вы.

Романистов вы вряд ли разоблачаете, но идея работает и в малом масштабе. Студенты составляют частотный словарь иностранного текста перед чтением. Преподаватели прогоняют сочинения через счётчик и видят, не сменился ли вдруг словарный запас студента между работами. Исследователи начинают с него контент-анализ: сначала посчитать, потом интерпретировать.

Водность и тошнота: две цифры, которые у нас спрашивают

Русские сервисы вроде Advego и text.ru приучили всех к двум показателям, и оба считаются прямо над таблицей.

Водность — доля служебных слов от всех слов текста: предлоги, союзы, местоимения, частицы, вводные. Формула в одну строку, но подвох в списке: у каждого сервиса он свой. У нас около 250 русских и английских служебных слов, у Advego список заметно шире, поэтому их процент и наш — разные шкалы. Сравнивать нужно свои тексты между собой, а не наше число с чужим нормативом. По нашему списку русские статьи обычно дают 22–28%, английские — 33–43%: в английском артикли и вспомогательные глаголы обязательны там, где русский обходится падежом.

Классическая тошнота — квадратный корень из числа повторов самого частого слова. Определение Advego, и смысл у него специфический: показатель не падает при росте объёма. Шестнадцать повторов дают 4,00 и в заметке на 500 слов, и в книге на 300 страниц. Поэтому его смотрят не вместо плотности, а рядом с ней. Ориентир — не выше 7, то есть не больше 49 повторов одного слова.

Академическая тошнота — доля самого частого значимого слова среди значимых. Включите «Скрыть служебные слова», и процент в первой строке таблицы и будет ей. Единой формулы у сервисов нет, так что публикуемые нормы вроде «5–15%» переносить между инструментами нельзя.

Словосочетания считаются отдельно

Частотный счётчик работает с отдельными словами. Между тем ключ почти всегда состоит из двух-трёх слов, и по отдельности его части ничего не говорят: «частотность» и «слов» в верхних строках таблицы не значат, что фраза «частотность слов» вообще встречается в тексте подряд.

Для биграмм и триграмм нужен другой инструмент — проверка плотности ключевых слов считает сочетания из двух и трёх слов и отдельно оценивает один целевой ключ. Порядок работы обычно такой: сначала частотность слов, чтобы увидеть словарь и повторы, потом плотность сочетаний, чтобы проверить сам ключ.

Что счётчик считает словом

Любую последовательность букв или цифр, так что «кто-то» и «во-первых» считаются одним словом, а не обломками. Знаки препинания отбрасываются. Кириллица, диакритика и иероглифы работают: инструмент делит текст по категориям Юникода, а не в расчёте на английский.

Правило чуть отличается от обычного счётчика слов, который делит текст только по пробелам. На связном тексте итоги совпадают, но расходятся там, где много знаков: одиночное тире там слово, а здесь нет. Если нужен просто объём — в знаках, страницах или авторских листах — быстрее взять его.

Регистр по умолчанию не учитывается — «Текст» и «текст» складываются вместе. Включите учёт регистра, если важно отделить имена собственные от нарицательных.

Чего счётчик не делает — так это не приводит слова к начальной форме. «Ключ», «ключа» и «ключом» останутся тремя строками. Это сознательный отказ: морфологический разбор русского требует словаря, спотыкается на омонимах вроде «стекло» и превращает проверяемую арифметику в чёрный ящик. Практический обход — поставить минимальную длину слова 4–5 и читать словоформы одного корня группой.

Всё работает в браузере. Текст не отправляется ни на какой сервер, поэтому вставлять неопубликованную рукопись или конфиденциальный отчёт безопасно.

Вставьте что-нибудь в Частотность слов и посмотрите на верх своего списка — слово-костыль у вас уже есть, вы просто ещё с ним не знакомы. Если таблицу нужно унести дальше, кнопка «Скачать CSV» отдаёт её в UTF-8 с BOM, и Excel открывает кириллицу без кракозябр.

Попробуйте инструмент

Частотность слов →