ИИ-терапевт снизил симптомы депрессии на 51%: что показало первое клиническое испытание
В 2025 году в одном из самых авторитетных медицинских журналов мира — NEJM AI — были опубликованы результаты первого в истории рандомизированного клинического испытания генеративного ИИ-терапевта. Итог: снижение симптомов депрессии на 51%. Это не реклама — это рецензируемая наука, и её стоит прочитать внимательно: и ради того, что она доказывает, и ради того, что она намеренно доказать не пытается.
Испытание в цифрах
В исследовании тестировали систему Therabot (Heinz et al., 2025, NEJM AI, DOI 10.1056/AIoa2400802). В нём участвовали 210 взрослых с диагнозами большого депрессивного расстройства, генерализованного тревожного расстройства или клинически значимых симптомов расстройств пищевого поведения. Их случайно распределили в две группы: четыре недели доступа к ИИ-терапевту или стандартный лист ожидания. Четырёхнедельный период наблюдения отслеживал, удержится ли результат. В среднем участники набрали более шести часов общения с системой за испытание.
| Группа | N | Состояние | Снижение симптомов | Размер эффекта (d) |
|---|---|---|---|---|
| Therabot | 106 | Депрессия | −51% | 0.845–0.903 |
| Therabot | 106 | Тревога | −31% | 0.794–0.840 |
| Therabot | 106 | Симптомы РПП | −19% | 0.627–0.819 |
| Лист ожидания | 104 | (без активного лечения) | — | — |
Две вещи делают эти цифры примечательными. Во-первых, размеры эффекта велики — d около 0.85 для депрессии находится в диапазоне, который клиницисты связывают с эффективной очной терапией, а не с приложением для самопомощи. Во-вторых, участники оценили терапевтический альянс — ощущение понимания и доверия к взаимодействию — по шкале WAI-SR примерно в 3.6, что сопоставимо с показателями, обычно сообщаемыми для живых терапевтов. Систему делали не наспех: её разрабатывали шесть лет команда из более чем 100 исследователей в Центре технологий и поведенческого здоровья Дартмутского колледжа, используя экспертно дообученную генеративную модель, а не готовый чат-бот.
Показатель вовлечённости легко пролистать, но он рассказывает свою историю. Более шести часов взаимодействия за четыре недели — это серьёзная «доза», примерно эквивалент нескольких терапевтических сессий, и значительная её часть пришлась на время вне обычных часов работы клиники, когда живой терапевт попросту недоступен. Испытание также стратифицировало участников по трём очень разным диагностическим группам, и улучшение симптомов РПП стоит выделить: расстройства пищевого поведения печально известны своей устойчивостью, и увидеть, как генеративная система сдвигает эту стрелку хотя бы на 19%, было одним из более неожиданных результатов. Это не закрывает спор, но показывает, что эффект не ограничился единственным самым лёгким состоянием.
Почему это испытание важно
Therabot — не первая попытка создать ИИ-терапевта, но первая генеративная, взявшая эту планку строгости. Предыдущее поколение было основано на правилах и сценариях. Woebot, запущенный в 2017 году, показал умеренный, но реальный эффект при депрессии у студентов: d = 0.44 в исходном исследовании (Fitzpatrick, Darcy, Vierhile, 2017), при 83% удержания и в среднем около 12 сессий. Позже он получил статус FDA Breakthrough Device и вошёл в более крупное контролируемое испытание при постпартальной депрессии. Wysa обработала более 400 миллионов разговоров в 65 странах и заслужила свой статус FDA Breakthrough для депрессии и тревоги, сопутствующих хронической боли.
Контролируемых данных у той первой волны было немного. Tess, оценённая Fulmer и коллегами (2018), дала значимое снижение депрессии с d = 0.68 в исследовании 75 человек. Youper — приложение, сочетающее техники КПТ, ACT и DBT, — сообщило о снижении тревоги (d = 0.60) и депрессии (d = 0.42) за четыре недели в обсервационном исследовании более 4 500 платных пользователей (Mehta et al., 2021). Полезные цифры, но ни одна из этих систем не проходила испытание с методологическим весом Therabot.
Что отличает Therabot от всех них — это сочетание генеративной модели, которая составляет каждый ответ с нуля, а не выбирает из сценарного дерева решений, с рандомизированным контролируемым дизайном и размерами эффекта примерно вдвое больше, чем в эпоху правил. Сценарный бот может сказать лишь то, что предусмотрели его создатели; генеративный способен пойти за человеком туда, куда не вёл ни один сценарий. Именно эта гибкость делает его и полезнее, и рискованнее — поэтому команда Therabot сопроводила его постоянным человеческим мониторингом. Это первый серьёзный сигнал, что система, достаточно гибкая, чтобы вести открытый разговор, способна давать и клинически значимое изменение в контролируемых условиях, — настоящая веха и причина, по которой исследование вызвало комментарии по всему полю. Стоит отметить рядом: по состоянию на конец 2025 года ни один генеративный ИИ-инструмент для психического здоровья не получил полного одобрения FDA, так что даже этот результат падает в ещё формирующийся регуляторный ландшафт.
Чего оно не доказывает
Те же комментарии быстро указали на ограничения исследования, и серьёзное отношение к ним — это то, что отличает доказательство от хайпа. Три ограничения важнее всего (их подняли Bakoyiannis, 2025, Nature Mental Health; Heckman, 2025, NEJM AI; и редакционная статья The Lancet Psychiatry 2025 года):
- Сравнение было с листом ожидания, а не с активным лечением. Контрольная группа не получала помощи вообще. Такой дизайн может показать, что Therabot лучше, чем ничего, но не что он сравним с живым терапевтом или превосходит его — или даже другое приложение. Часть измеренного улучшения в любом испытании с листом ожидания отражает внимание, ожидание и течение времени.
- Мера альянса может не переноситься. Шкала WAI-SR создавалась, чтобы уловить связь между клиентом и живым терапевтом. Означает ли высокий балл в адрес ИИ то же самое — или измеряет что-то иное, например комфорт безоценочного интерфейса, — по-настоящему спорно.
- Страховочная сеть не масштабируется как есть. Каждый диалог в испытании мониторился в реальном времени исследовательской командой. Этот интенсивный человеческий надзор — часть того, почему испытание было безопасным; его же трудно воспроизвести в продукте, которым одновременно пользуются тысячи людей.
Ничто из этого не перечёркивает результат. Оно его обрамляет: Therabot — сильное предварительное доказательство, а не окончательный вердикт, и сами исследователи призвали к более крупным испытаниям с активными компараторами и независимой оценкой.
Как это соотносится с мета-анализом
Одна цифра ставит Therabot в контекст. По всей широкой литературе цифровые интервенции обычно достигают размеров эффекта около 0.20–0.30 по сравнению с примерно 0.80 для очной терапии (The Lancet Psychiatry, 2025). Эффект Therabot по депрессии лежит намного выше этой цифровой базы — именно поэтому он привлёк внимание и именно поэтому одно испытание пока нельзя принять за новую норму.
Наиболее полную картину поля даёт мета-анализ Linardon и коллег (2024, World Psychiatry) — 176 рандомизированных контролируемых испытаний мобильных приложений для депрессии и тревоги. На фоне этого корпуса работ Therabot выглядит скорее возможной точкой перегиба, чем выбросом, который стоит отбросить, — намёком на то, что генеративный подход может начать сокращать разрыв между цифровыми инструментами и очной помощью. Честное прочтение таково: одно сильное испытание поднимает потолок возможного, ещё не сдвигая пол доказанного; воспроизвести его с активными компараторами — следующий настоящий тест. Мы разбираем объединённые данные в нашем мета-анализе ИИ-чат-ботов для терапии, а исследования структурированных программ, на которые он опирается, — в обзоре работ по КПТ-чат-ботам.
FAQ
Может ли ИИ-терапевт лечить депрессию?
В одном строгом испытании генеративный ИИ-терапевт снизил симптомы депрессии на 51%, с размером эффекта, сопоставимым с очной терапией. Это реальное рецензируемое доказательство того, что хорошо сделанная система может помочь. Но «помощь в мониторируемом четырёхнедельном исследовании против листа ожидания» — не то же, что «лечить» в клиническом смысле: не показано, что система сравнима с живым терапевтом, и она работала при таком уровне человеческого надзора, какого у большинства продуктов нет.
Доказана ли ИИ-терапия клинически?
Отчасти и с осторожностью. Инструменты на правилах вроде Woebot и Wysa имеют статусы FDA Breakthrough и умеренные данные испытаний, а Therabot — первая генеративная система с опубликованным РКИ. Но средние размеры эффекта в поле остаются ниже, чем у очной терапии, а большинство инструментов вообще не тестировались на таком уровне строгости. «Многообещающе и улучшается» — более честное описание, чем «доказано».
Стоит ли заменить своего терапевта на ИИ?
Нет. Лучшие имеющиеся данные поддерживают ИИ как дополнение, а не замену — полезное для поддержки между сессиями, для людей в длинных очередях или там, где клинициста нет вовсе. Это не замена психологу, психотерапевту или психиатру, и он не справится с кризисом. Если вы в терапии, разумный шаг — использовать эти инструменты вместе со своим терапевтом, а не вместо него.
«Рядом» — инструмент поддержки, использующий принципы доказательной психологии. Он не заменяет психолога, психотерапевта, психиатра или экстренную службу. Если вы в кризисе, немедленно обратитесь в местные экстренные службы или на кризисную линию.