Перейти к основному содержанию
AI и современная терапия

Цифровое фенотипирование: как телефон и ваши слова выдают депрессию

Автор: Nearby Опубликовано 2 марта 2026 г. Обновлено: 5 июля 2026 г. 10 мин чтения

Ваш смартфон знает о вашем психическом здоровье больше, чем кажется. GPS-треки, паттерны звонков, скорость набора, режим сна, звук голоса, выбор слов — всё это может сигнализировать о сдвиге настроения, иногда раньше, чем вы заметите его сами. Наука о чтении этих сигналов называется цифровым фенотипированием, и сегодня она охватывает два канала: то, что выдаёт ваше поведение, и то, что выдают ваши разговоры.

Что такое цифровое фенотипирование

Термин ввёл Thomas Insel, бывший директор Национального института психического здоровья США, в статье в JAMA (2017, 318:1215–1216). Идея проста: телефон, который вы носите повсюду, накапливает огромные объёмы поведенческих данных, и, если научиться правильно их читать, можно построить непрерывный «портрет» психического состояния человека — куда более информативный, чем осмотр раз в три месяца.

Insel выделил три типа данных. Первый — сенсорные данные: GPS-местоположение, акселерометрия и время активности. Второй — голос и речь: сентимент и просодия, мелодика того, как человек говорит. Третий — взаимодействие человек–компьютер: латентность между нажатиями клавиш, интервалы прокрутки, длительность удержания внимания на экране. Каждый канал — окно в поведение, о котором человек никогда не подумал бы рассказать в кабинете врача.

Сила подхода в том, что сигналы опережают самоосознание. В пилотном исследовании 17 пациентов с шизофренией Barnett, Torous и коллеги (2018, Neuropsychopharmacology, 43:1660–1666) обнаружили статистически значимые аномалии паттернов мобильности за несколько дней до рецидива. Телефон отметил приближающийся кризис раньше, чем человек — или его врач — заметили неладное. Позже Insel подобрал метафору из другой области медицины: непрерывный мониторинг психического здоровья, по его мысли, может работать как «пожарная сигнализация» (2018, World Psychiatry) — раннее предупреждение, а не диагноз постфактум.

Специализированные платформы делают такие исследования возможными. Beiwe, разработанная John Torous и коллегами из Гарвардской медицинской школы, собирает GPS, акселерометрию, логи звонков и сообщений и голосовые образцы, оставаясь HIPAA-совместимой; при масштабировании её стоимость падает примерно с $80 до $3.50 на субъекта в месяц. Родственная платформа mindLAMP (Beth Israel Deaconess/Harvard) объединяет этот пассивный поток с активными опросниками и когнитивными тестами. Систематический обзор Linardon и коллег (2025) по 112 исследованиям установил, что GPS — самый используемый датчик, средняя длительность исследования — 14.3 недели, а большинство работ выполнены на Android: снимок поля, которое реально, но пока молодо.

Один тонкий вывод определяет то, как всё это анализируют. Torous и коллеги (2021, World Psychiatry, 20:318–335) показали, что вариационные показатели — энтропия рутины или то, насколько сегодняшний день отклоняется от персональной средней человека, — информативнее абсолютных значений датчиков. Дело не в том, что вы посетили сегодня два места; дело в том, что обычно вы посещаете шесть. Психическое состояние проявляется в изменении относительно вашей собственной нормы, а не в универсальном пороге.

Что выдают ваши разговоры

Поведение — лишь половина картины. Депрессия меняет и то, как люди говорят и пишут, и второй исследовательский поток читает этот канал напрямую.

Голос — на удивление богатый маркер. Депрессия делает его более монотонным, замедляет артикуляцию, растягивает паузы между словами. Briganti и Lechien (2025, Journal of Voice) обобщили 12 исследований с участием 16 872 человек и установили, что голосовые биомаркеры различают депрессию и здоровую норму с AUC от 0.71 до 0.93 — от умеренного до сильного, в зависимости от метода и популяции. Один коммерческий инструмент, Kintsugi Voice, определяет депрессию или тревогу из всего 20 секунд свободной речи с точностью около 80% (Mazur и коллеги, 2025, Annals of Family Medicine, 23:60–65).

Текст несёт свои сигналы. Долгая серия исследовательских соревнований — AVEC (Audio/Visual Emotion Challenge, 2013–2019) — двигала большую часть работ по мультимодальной детекции депрессии, а её датасет DAIC-WOZ, записи клинических интервью с виртуальным агентом, стал стандартным бенчмарком. На языковой стороне Tauscher и коллеги (2023, Psychiatric Services) применили дообученную модель BERT к текстовым сообщениям между пациентами с тяжёлыми психическими расстройствами и клиницистами, достигнув F1 = 0.62 — фактически на уровне человеческих рейтеров (0.63).

Депрессия проявляется и на лице. Сниженная вариабельность мимики — один из признанных поведенческих маркеров, и соревнования AVEC намеренно сочетали аудио с видео именно потому, что ни один канал не рассказывает всю историю. Наиболее надёжные исследовательские системы сливают сразу несколько — голос, слова и движения лица — исходя из логики, что маркер, упущенный одной модальностью, часто ловится другой. Эта избыточность и делает такие системы трудными для случайного обмана: плоский голос в плохой день значит меньше, когда язык и выражение выглядят обычными.

Оценку языка можно проводить даже вживую, внутри обычного чата. Система MoPHES, описанная в IEEE в 2025 году, сочетает две компактные модели по 0.5 млрд параметров: одна незаметно оценивает тревогу и депрессию каждые несколько реплик, другая ведёт разговор с учётом этой оценки. Она достигла 80.5% точности для тревоги и 63% для депрессии, работая целиком на устройстве пользователя, — заметно превзойдя модели во много раз крупнее. Показатель по депрессии ниже по причине, повторяющейся во всём поле: апатию, замедление и избегание расслышать в словах труднее, чем страх и напряжение тревоги.

Почему чтение состояния из разговора так важно? По данным Доклада ВОЗ о психическом здоровье в мире (2022), около миллиарда человек живут с психическим расстройством — примерно 13% населения планеты, — и более 70% из них никогда не получают эффективной помощи. Отчасти этот разрыв — нехватка специалистов, но отчасти — то, что многие просто не осознают, что нуждаются в помощи, или не могут оценить серьёзность своего состояния. Инструмент, который оценивает настроение из обычного разговора, меняет точку входа: без опросника, без записи к врачу, без необходимости сначала признать, что что-то не так. Вы просто говорите, а оценка тихо едет вместе с диалогом.

Датчики против слов: что работает лучше

Ни один канал не лучше строго; они видят разное и по разной цене.

Тип сигналаЧто выявляетСила доказательствЦена приватности
GPS / мобильностьУход в себя, распад рутины, риск рецидиваСигнал за дни до рецидива в малых когортах; нужна персональная базаВысокая — непрерывная история местоположения
Набор / взаимодействиеНарушение сна, ажитация, замедлениеРанняя стадия, слабее валидированоСредняя — поведенческие метаданные
Голос / просодияДепрессия, тревога по качеству речиAUC 0.71–0.93 по 16 872 людямСредняя — аудио идентифицирует
Текст / языкНастроение, когнитивные искажения, дистрессBERT F1 ≈ человеческие рейтеры (0.62 против 0.63)Высокая — содержание личных сообщений

Сенсорные данные пассивны и непрерывны, но грубы: они говорят, что что-то изменилось, редко — что именно. Язык острее насчёт содержания и эмоции, но реже — он существует лишь тогда, когда человек говорит или пишет. Наиболее убедительные системы сочетают их и опираются на вариационный вывод выше: цель — уловить отклонение от собственной нормы человека, а не совпадение с общепопуляционным порогом. Чтобы понять модели, превращающие эти сырые сигналы в картину психического состояния, см. наш обзор вычислительных моделей психических расстройств; о более рискованном частном случае — распознавании кризисного языка — см. как ИИ выявляет суицидальный риск в тексте.

Пределы и этика

Пассивное измерение поднимает трудные вопросы, и честность о них — часть ответственного подхода.

Первый — ложные срабатывания. Детектор, отмечающий приближающееся снижение настроения, иногда ошибётся, и каждая ложная тревога несёт цену — лишнее беспокойство, подорванное доверие или вмешательство, которого никто не хотел. Чувствительность и специфичность идут на компромисс друг с другом; нет настройки, которая ловит всё и при этом никогда не поднимает ложную тревогу.

Второй — приватность. GPS-треки, паттерны коммуникации, сон и социальная активность — среди самых чувствительных данных, которые производит человек, а содержание сообщений или звук голоса напрямую идентифицируют. Именно поэтому так важно, где происходит обработка: модель, работающая на вашем устройстве и хранящая данные локально, имеет куда меньшую поверхность утечки, чем та, что стримит всё на сервер. Мы разбираем этот компромисс подробнее в материале об ИИ-терапии на устройстве и приватности. Исследователи также разрабатывают модели «динамического согласия», позволяющие человеку в любой момент выбирать, какими данными он готов делиться.

Третий — граница между мониторингом и диагностикой. Цифровое фенотипирование — инструмент мониторинга. Оно может сообщить клиницисту, что что-то заслуживает внимания; оно само по себе не ставит диагноз, а скрининговая точность — не клиническая точность. Ответственный продукт трактует сигнал как повод проверить, как дела, и при необходимости направить человека к реальной помощи — но никогда как приговор. Наш материал о гардрейлах для ИИ в психическом здоровье описывает, как выглядит такое ответственное обращение на практике.

Цифровые технологии здоровья развиваются быстро, и сервисы вроде «Рядом» используют доказательные подходы для поддержки психического здоровья. Цифровое фенотипирование ещё идёт из лаборатории в повседневную практику, но инструменты, построенные на когнитивно-поведенческой терапии, уже доступны каждому — прямо на телефоне, который несёт все эти сигналы.

FAQ

Может ли смартфон действительно выявить депрессию?

Он может выявить сигналы, связанные с депрессией, — изменения в движении, сне, голосе и языке, которые сдвигаются, когда сдвигается настроение. В исследованиях аномалии мобильности предшествовали рецидиву за дни, а голосовые биомаркеры отделяют депрессию от здоровой нормы с AUC вплоть до 0.93. Но выявить сигнал — не то же, что поставить диагноз. Телефон может поднять флаг; решение принимает клиницист.

Читает ли ИИ мои сообщения, чтобы оценить настроение?

Некоторые системы анализируют язык, и лучшие из них устроены так, что это происходит на вашем устройстве, а не на серверах компании. В архитектуре MoPHES, например, оценка выполняется локально и ничего не отправляется в облако. Где и как обрабатывается ваш текст — именно тот вопрос, который стоит задать любому приложению с такой функцией: ответ определяет и риск приватности, и часто то, работает ли оно офлайн.

Насколько точно цифровое фенотипирование?

Зависит от сигнала. Голосовые биомаркеры достигают AUC 0.71–0.93; текстовые модели могут сравняться с человеческими рейтерами (F1 около 0.62); модели разговора на устройстве достигают около 80% для тревоги, но ниже для депрессии, которую труднее прочитать в словах. В целом точность растёт, когда модель сравнивает вас с вашей же базой, а не с фиксированным порогом. Это перспективная скрининговая технология, а не замена профессиональной оценки.

«Рядом» — инструмент поддержки, использующий принципы доказательной психологии. Он не заменяет психолога, психотерапевта, психиатра или экстренную службу.