Количество символов в тексте: как посчитать и какую цифру брать
Сколько символов в тексте, чем отличаются знаки с пробелами и без, сколько их влезает в SMS и пост, и как посчитать символы в Word, Google Документах и Excel.
Короткий ответ: чтобы узнать количество символов в тексте, вставьте его в счётчик символов — цифра появится сразу, без кнопок и регистрации. Но одной цифры обычно мало, потому что «символы» бывают четырёх разных видов, и от того, какой из них имел в виду заказчик или площадка, зависит, сойдётся ли у вас с ними счёт.
С пробелами или без — разница в 14–18%
Это главный вопрос, а не технический нюанс. Знаки с пробелами — длина текста целиком: каждая буква, цифра, знак препинания, пробел и перенос строки. Знаки без пробелов — то же самое, но пробельные символы выброшены.
На русском тексте пробелы занимают 14–18% объёма — тем меньше, чем длиннее слова. В предложении «Краткость — сестра таланта, но заказчик платит за тысячу знаков без пробелов.» — 77 знаков с пробелами и 66 без. На заказе в 20 000 знаков такая разница даёт около трёх тысяч знаков, то есть целую статью.
Кто что имеет в виду:
- Биржи копирайтинга и заказчики текстов — почти всегда без пробелов. «1000 знаков» в ТЗ означает 1000 знаков без пробелов, если явно не написано обратное.
- Бюро переводов и издательства — с пробелами. Переводческая страница — 1800 знаков с пробелами, авторский лист — 40 000.
- Соцсети, мессенджеры, SMS, поля форм — с пробелами. Пробел занимает в лимите ровно столько же места, сколько буква.
Полная таблица с источниками единиц — на странице счётчика. Если объём нужен в страницах и авторских листах, это считает счётчик слов.
Сколько символов влезает: лимиты площадок
| Где | Символов | Что важно |
|---|---|---|
| SMS, кириллица | 70 | дальше по 67 за сегмент |
| SMS, только латиница | 160 | дальше по 153 |
| X (Twitter) | 280 | ссылка всегда считается за 23 |
| Telegram, сообщение | 4096 | длиннее — режется автоматически |
| Telegram, подпись к фото | 1024 | 2048 у Premium |
| ВКонтакте, запись | 16 384 | в ленте видно около 350 |
| Instagram, подпись | 2200 | до «ещё» видно около 125 |
| Instagram, описание профиля | 150 | переносы строк тоже считаются |
| YouTube, заголовок | 100 | в поиске обрезается около 60 |
| Title | ≈60 | Яндекс показывает 52–70 |
| Description | ≈160 | Яндекс иногда берёт до 300 |
Обратите внимание на разрыв между лимитом и видимой частью. У записи ВКонтакте лимит 16 384 символа, а до «Показать полностью» читается около 350. Лимит говорит, сколько поместится; видимая часть — сколько прочитают. Поэтому главную мысль всегда выносят в первое предложение.
Почему русское SMS вдвое короче английского
Стандарт GSM-7 — фиксированная таблица на 128 знаков: латиница, цифры, базовая пунктуация и десяток европейских букв. Кириллицы в ней нет вообще. Как только в сообщении появляется хоть одна русская буква, оператор перекодирует всё сообщение в двухбайтовую UCS-2, и вместимость падает со 160 символов до 70.
Длинный текст режется на сегменты — по 153 символа в GSM-7 и по 67 в UCS-2, потому что заголовок склейки занимает место в каждом сегменте. Платят за сегменты, а не за сообщения.
Отсюда два следствия. Первое: эмодзи в конце русского сообщения ничего не меняет — кириллица и так увела его в UCS-2. Второе: то же эмодзи в английском тексте на 139 знаков превращает один сегмент в три. Тихая версия той же ловушки — длинное тире «—» и «ёлочки», которые подставляет автозамена в Word: в GSM-7 их нет, а обычного дефиса и прямых кавычек — есть. Таблица с посчитанными примерами показывает оба случая.
Как посчитать символы в Word, Google Документах и Excel
Word. Вкладка «Рецензирование» → «Статистика», либо клик по счётчику слов в строке состояния. В окне есть обе цифры — с пробелами и без. Галочка «Учитывать надписи, сноски и концевые сноски» по умолчанию снята, и именно она объясняет большинство расхождений с онлайн-счётчиками. Чтобы посчитать фрагмент, а не весь документ, выделите его перед открытием статистики.
Google Документы. «Инструменты» → «Статистика» или Ctrl+Shift+C. Там же галочка «Показывать статистику при вводе текста». Отдельной цифры «без пробелов» Google Документы не дают вовсе — её приходится считать снаружи.
Excel и Google Таблицы. Длина строки — =ДЛСТР(A1) в русском интерфейсе, =LEN(A1) в английском. Без пробелов — =ДЛСТР(ПОДСТАВИТЬ(A1;" ";"")). Сумма по столбцу — =СУММПРОИЗВ(ДЛСТР(A1:A100)).
Командная строка. wc -m file.txt считает символы, wc -c — байты. На русском тексте они разойдутся почти вдвое, и это не ошибка: см. следующий раздел.
Четыре разных «количества символов»
Для обычного русского текста все счётчики сходятся. Расходятся они на эмодзи, буквах с диакритикой и иероглифах — и именно там ломаются формы и поля баз данных.
| Текст | Символов | Видимых | UTF-16 | Байт UTF-8 |
|---|---|---|---|---|
| привет | 6 | 6 | 6 | 12 |
| ё | 1 | 1 | 1 | 2 |
| 🙂 | 1 | 1 | 2 | 4 |
| 👨👩👧 | 5 | 1 | 8 | 18 |
Символы — кодовые точки Unicode, цифра площадок и полей ввода. Видимые — то, что человек считает одним знаком: семья 👨👩👧 собрана из трёх человечков и двух невидимых соединителей. UTF-16 — то, что вернёт String.length в JavaScript: наивная обрезка строки по этой длине способна разрезать эмодзи пополам. Байты UTF-8 — место в файле и в колонке базы данных.
Последнее — самая частая ошибка в бэкенде. Ограничения в базах и API часто заданы в байтах: латинская буква занимает 1 байт, кириллическая — 2, иероглиф — 3, эмодзи — 4. «Привет, мир!» — это 12 символов, но 21 байт, и в колонку с лимитом в 15 байт такой текст не поместится, хотя по символам запас есть. Таблица целиком — на странице счётчика.
Кириллица и латиница в одном тексте
Счётчик показывает буквы кириллицы и латиницы отдельными числами, и это полезно не только для статистики. Если в русском слове случайно осталась латинская «c», «a», «e» или «o» — классическая беда текстов, прошедших через автозамену или распознавание, — сумма по двум колонкам это сразу покажет. Визуально такие буквы неотличимы, а поиск по документу их не находит.
Частые расхождения
Word показывает меньше. Почти всегда дело в снятой галочке «Учитывать надписи и сноски». Скрытый текст и часть содержимого таблиц тоже учитываются не всегда.
Онлайн-счётчики расходятся между собой на несколько знаков. Одни молча обрезают хвостовые пробелы и последний перенос строки, другие нет. В Windows конец строки исторически состоит из двух символов (CR и LF), а в Linux и macOS — из одного, поэтому один и тот же файл считается по-разному на разных системах.
«Без пробелов» считается по-разному. У нас это текст без всех пробельных символов — пробелов, табуляций и переносов строк. В Word вычитаются только пробелы, поэтому на тексте из множества коротких строк Word насчитает чуть больше. Если текст пришёл из вёрстки, уберите лишние пробелы перед подсчётом: за двойные пробелы платят, а читатель их не видит.
Что дальше
Счётчик символов работает полностью в браузере — без сервера, без загрузки файлов, без регистрации. Вставьте текст, и обновятся сразу все цифры: символы с пробелами и без, буквы кириллицы и латиницы, цифры, пробелы, прочие знаки, видимые символы, байты UTF-8, а также остаток до лимитов X, Telegram и Instagram и число SMS-сегментов.