Заметки о ведении дневника · · 5 мин чтения
Голосовой дневник: как наговаривать записи и не стыдиться расшифровки
Почему говорить в телефон втрое быстрее, чем печатать, откуда неприязнь к своему голосу, что известно о рассказе вслух, и как устроена расшифровка, которая не покидает устройство.
- голосовой дневник
- голосовые записи
- расшифровка голоса
- дневник
- приватность
В 2018 году группа из Стэнфорда и Вашингтонского университета посадила людей за телефон и попросила набирать одни и те же короткие сообщения двумя способами: пальцами на экранной клавиатуре и голосом через распознавание речи. По-английски и по-китайски, с замером скорости и ошибок после правки.
По-английски голос оказался примерно втрое быстрее клавиатуры, по-китайски в два и восемь десятых раза, и ошибок в итоговом тексте у голоса было меньше, а не больше. Это измеряли на коротких фразах, не на дневниковых записях, но соотношение понятное: за минуту ты говоришь столько, сколько печатал бы три.
И всё равно большинство людей, которых я знаю, записи наговаривать не хотят. Не из-за скорости. Из-за того, что потом нужно это слушать или читать.
Почему свой голос противный
Этому ощущению есть имя и дата. В 1966 году Филип Хольцман и Клайд Раузи описали «конфронтацию с голосом»: людям давали послушать записи, среди которых была их собственная, и большинство реагировало на свою с недоумением или неприязнью, даже не всегда узнавая её. Объяснение двухслойное. Первый слой физика: изнутри ты слышишь себя ещё и через кости черепа, которые добавляют низкие частоты, и в записи голос кажется выше и тоньше, чем «должен». Второй слой интереснее: в записи слышно то, что ты обычно не замечаешь, когда говоришь. Неуверенность, спешку, интонацию, с которой ты не согласен.
С расшифровкой то же самое, только на бумаге. Устная речь выглядит в тексте плохо. «Ну», «как бы», повторы, фразы, которые начались и не закончились. Печатный текст ты редактируешь на ходу, и он выходит ровнее, чем мысль. Расшифровка показывает мысль как она была: с заминками в тех местах, где ты на самом деле не знал, что думаешь.
Вот здесь и ловушка. Расшифровку хочется исправить или удалить, потому что она «некрасивая». Но некрасивость и есть содержимое записи. Заминка перед словом «нормально» в ответе на вопрос «как день» информативнее самого слова.
Рассказать вслух работает не хуже, чем написать
Большая часть того, что известно о пользе дневника, получена на письме: человек пишет о тяжёлом по двадцать минут несколько дней подряд. Но две работы проверяли и голос.
В 1994 году Брайан Эстерлинг с коллегами разделили студентов на три группы: одни писали о стрессовом событии, другие рассказывали о нём вслух на диктофон, третьи писали на нейтральные темы. Мерили не самочувствие, а биологический маркер нагрузки на иммунитет. Изменения были в обеих группах с раскрытием, и у тех, кто говорил, они оказались более выраженными, чем у тех, кто писал. Выборка маленькая, студенты, одно исследование, так что из этого не следует, что голос «лучше». Следует, что медиум важен меньше, чем сам акт перевода события в слова.
В 2006 году Соня Любомирски с коллегами сравнили три способа обращаться с худшим событием жизни: писать, рассказывать вслух и просто думать. Писать и рассказывать помогало, думать не помогало, а иногда делало хуже. Подробнее про эту работу у меня есть в тексте о том, почему мы бросаем дневник, здесь важен один пункт: наговорить в телефон и написать в тетрадь попадают в одну категорию, а молча прокручивать в голове в другую.
Писать или говорить о тяжёлом событии помогало; думать о нём, не переводя в слова, не помогало.
Как наговаривать, чтобы потом не стирать
Представь человека, назовём его Костя, который три года не написал в дневник ни строки, потому что «нечего писать». Полгода назад он начал включать запись по дороге от метро до дома, девять минут. Говорит не кому-то, а вперёд, как будто вслух думает. Расшифровки не перечитывает неделями. Потом открывает поиск по слову «устал» и видит, что оно есть в восемнадцати записях из тридцати, и всегда во вторник. Это выдуманная история, но механика в ней настоящая: голосовая запись окупается в момент, когда её можно найти.
Что из этой механики следует практически.
Первая фраза любая. Не репетируй вступление. «Сегодня» или «значит так» годятся. Первые десять секунд всё равно разгон, их никто не оценивает.
Говори вперёд, не слушателю. Как только появляется воображаемый собеседник, появляется и стыд. Полезнее представлять, что ты думаешь вслух в пустой комнате. Это и есть дневник.
Минута или две. Дольше начинаешь повторяться. Если осталось, что сказать, лучше вторая запись, чем десятиминутная первая.
Не переслушивай сразу. Прямо после записи голос ещё в ушах, и сработает эффект Хольцмана и Раузи. Через неделю ты уже слушаешь не голос, а человека, который это сказал.
Расшифровка это черновик для поиска, а не текст. Её задача, чтобы через месяц нашлось слово. Красота не требуется.
Где голос лучше текста
Утром с закрытыми глазами, пока сон не рассыпался: про это отдельный текст о дневнике снов. В дороге, когда руки заняты. Когда злишься: слова идут быстрее, чем пальцы, и запись получается честнее, чем если дать себе время сформулировать. Когда «нечего писать»: говорить о пустом дне проще, чем писать о нём, потому что говорить ты и так умеешь, а писать нужно собираться.
Где голос хуже: в комнате с другими людьми, в очереди, и когда хочется подобрать слово. Текст для этого и существует.
Куда уходит голос
Теперь то, что обычно пишут мелким шрифтом. Распознавание речи на телефоне бывает двух видов: на самом устройстве и на сервере. В документации Apple для разработчиков есть переключатель, который требует обработку только на устройстве; если он включён, аудио никуда не отправляется, а если локальное распознавание на этом телефоне недоступно, запрос просто не выполнится вместо того, чтобы тихо уйти в сеть.
В Lanternly этот переключатель включён всегда. Голос записывается, расшифровывается на iPhone, и у расшифровки нет сетевого пути. Из этого есть три честных следствия.
Первое: локальная расшифровка работает через системную диктовку iOS. Если в настройках телефона диктовка выключена, текста не будет, и приложение покажет это прямо, а не бесконечное «расшифровываю». Включается в Настройках, раздел «Основные», «Клавиатура». Второе: язык распознавания следует языку интерфейса приложения, русский или английский. Третье: локальная модель хуже серверной на именах, терминах и шёпоте. Аудио в любом случае остаётся в записи, и расшифровку можно запустить повторно.
Если тебе важно, куда уходят голосовые записи, в чек-листе приватного дневника есть пункт именно про это: спросить у приложения, где расшифровывается голос, а не только где хранится текст.
Одна минута
Запиши сегодня одну минуту. Не слушай. Через неделю открой расшифровку, найди в ней самое неуклюжее место и посмотри, о чём оно. Скорее всего, именно там и было то, ради чего стоило записывать.
Источники
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., Landay, J. A. Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 1–23, ACM (2018)
- Holzman, P. S., Rousey, C. The voice as a percept. Journal of Personality and Social Psychology, 4(1), 79–86, American Psychological Association (1966)
- Esterling, B. A., Antoni, M. H., Fletcher, M. A., Margulies, S., Schneiderman, N. Emotional disclosure through writing or speaking modulates latent Epstein-Barr virus antibody titers. Journal of Consulting and Clinical Psychology, 62(1), 130–140, American Psychological Association (1994)
- Lyubomirsky, S., Sousa, L., Dickerhoof, R. The costs and benefits of writing, talking, and thinking about life's triumphs and defeats. Journal of Personality and Social Psychology, 90(4), 692–708, American Psychological Association (2006)
- requiresOnDeviceRecognition. Speech framework documentation, Apple Developer