Фото бланка в ChatGPT, DeepSeek или Алису, и через десять секунд готовое «объяснение». Удобно, бесплатно, круглосуточно. Проблема в том, что ответ выглядит одинаково уверенно и когда он верный, и когда нет. В этой статье разбираем, что показали проверки чат-ботов на лабораторных бланках, в каких шести местах их ответ нужно перепроверять и как задать вопрос так, чтобы получить пользу, а не тревогу.
Типичная сцена: пришло письмо из лаборатории, три строчки подсвечены красным, запись к терапевту через восемь дней. Человек вставляет фото в чат-бот и спрашивает: «Это опасно?». Дальше два сценария: либо ночь без сна из-за «возможной патологии печени», либо успокоенное «всё в пределах нормы», хотя цифра требовала звонка врачу сегодня.
Что здесь реальная проблема
Настоящая проблема не в нейросетях, а в разрыве между результатом и объяснением. Лаборатория присылает бланк за сутки, а человек, который умеет его читать, доступен через неделю. В этом окне сидит тревога, и чат-бот занимает его просто потому, что отвечает мгновенно.
Отсюда честный вывод: советовать «не пользуйтесь» бесполезно. Полезно понимать, в каких местах ответ нейросети слаб, и закрыть эти места руками. Как самому читать общий анализ крови, мы разбирали в отдельном гиде, а какие анализы вообще стоит сдавать здоровому, в чек-апе без развода. Здесь только про то, что делать с ответом бота.
Что показали проверки
Оговорка сразу: собственный тест моделей мы не проводили и «процент ошибок ChatGPT» называть не будем. Ниже только опубликованные работы.
Самая показательная вышла в Nature Medicine. Оксфордская группа рандомизировала 1298 человек: одни разбирали медицинские сценарии с помощью GPT-4o, Llama 3 или Command R+, другие с помощью чего угодно по своему выбору. Сами по себе модели правильно называли состояние в 94,9% случаев. Но люди, пользовавшиеся теми же моделями, определили состояние менее чем в 34,5% случаев, а верно выбрали, что делать дальше, менее чем в 44,2%. Не лучше контрольной группы [1]. Модель знает, а связка «человек плюс модель» проваливается: люди недоговаривают контекст, задают вопрос криво, выхватывают из ответа не то.
Лабораторные бланки проверяли отдельно. Рабочая группа Европейской федерации клинической химии (EFLM) дала ChatGPT десять смоделированных отчётов с референсами и единицами. Бот распознал все показатели и верно отметил отклонения, но трактовка оказалась поверхностной, не всегда правильной, а величина отклонения почти не влияла на вывод: на «чуть выше нормы» и «в три раза выше» реакция была похожей [2]. Британская лаборатория дала ChatGPT и Bard 15 случаев по щитовидной железе: полностью верных трактовок 33,3% и 20,0%. Явный гипотиреоз и гипертиреоз боты видели, а субклинические формы, вторичный гипотиреоз и сдвиги на фоне другой болезни пропускали [3].
Есть и хорошая новость. В сравнении с ответами обычных людей на форуме, где пациенты спрашивали друг друга про анализы, GPT-4 оказался точнее и безопаснее «коллективного разума», хотя и у него встречались неверные утверждения и ответы без учёта ситуации конкретного человека [4]. Чат-бот лучше совета соседки из чата и хуже врача с бланком в руках. Это и есть его место.
Шесть мест, где ответ бота нужно перепроверить
Единицы измерения и пересчёт
Российские лаборатории считают глюкозу и холестерин в ммоль/л, креатинин в мкмоль/л, витамин D чаще в нг/мл. В англоязычных данных, на которых обучались модели, глюкоза, холестерин и креатинин в мг/дл, витамин D нередко в нмоль/л. Бот может молча применить американский референс к российской цифре. Глюкоза 5,6 ммоль/л это верхняя граница нормы натощак, а 5,6 мг/дл это несовместимая с жизнью гипогликемия. Витамин D 30 нг/мл достаточный уровень, 30 нмоль/л дефицит.
Что делать: писать единицы рядом с каждой цифрой и просить показать пересчёт, если бот сравнивает с зарубежными нормами.
Референсы вашей лаборатории, а не «средние по интернету»
Референсный интервал зависит от прибора, реагентов и населения, на котором его считали. Нидерландское исследование собрало интервалы ферритина у 52 сертифицированных лабораторий: даже на одинаковых анализаторах границы расходились, и доля женщин до менопаузы с «низким ферритином» колебалась от 11% до 53% в зависимости от того, чей референс применить [5]. Одна и та же цифра, а диагноз есть или нет. Для России интервалы гормонов и онкомаркеров выводили по международному протоколу IFCC отдельно, с разбивкой по полу и возрасту [6].
Бот, не видя ваших референсов, подставит свои. Верные для трактовки границы напечатаны на вашем бланке. Спор о том, где кончается «норма» и начинается «оптимум», мы разбирали отдельно.
Контекст, которого бот не знает
Модель видит цифры, но не видит вас. А трактовка меняется от:
- пола и возраста (ферритин у мужчин в четыре раза выше, чем у женщин до менопаузы [5]);
- беременности (гемоглобин, ТТГ, щелочная фосфатаза, D-димер сдвигаются физиологически);
- лекарств (биотин ломает гормональные тесты, статины двигают печёночные ферменты, метформин снижает B12);
- того, были ли вы натощак, тренировались ли накануне, сколько спали (креатинкиназа, АЛТ, глюкоза, кортизол);
- дня цикла для половых гормонов.
Про подготовку и типичные ошибки перед сдачей есть отдельный разбор. Если этого контекста нет в вопросе, бот примет усреднённого человека, и ответ будет про него, а не про вас.
Уверенный тон при неверном ответе и склонность соглашаться
Языковые модели обучены быть полезными, и это оборачивается уязвимостью: они выполняют нелогичную просьбу, даже когда «знают», что она нелогична. В работе Гарварда и MIT пять передовых моделей просили написать текст на основе ложной посылки о лекарствах; изначально они подчинялись вплоть до 100% случаев, и только формулировка «можешь отказаться, если посылка неверна» снижала долю ложных ответов [7]. В литературе это называют sycophancy, подстройка под собеседника. Для бланка это значит: «это ведь не опасно, правда?» и «насколько это опасно?» дадут разные ответы на одних и тех же цифрах.
Правило: не подсказывать желаемый вывод, спрашивать нейтрально и просить перечислить, что говорит за спокойный вариант и что против.
Болезнь в одном отклонении
Референсный интервал по определению охватывает 95% здоровых людей. Значит, у здорового человека каждый показатель выходит за границу с вероятностью 5%, а при 20 показателях в панели хотя бы одно «красное» значение появится примерно в двух случаях из трёх. Опытный врач смотрит на величину отклонения, динамику и сочетание с другими строчками. Бот в проверке EFLM величину отклонения почти игнорировал [2], а в тесте по щитовидной железе не отличал изолированный сдвиг от картины болезни [3]. Одна строка чуть за границей это повод пересдать, а не диагноз.
Приватность
Фото бланка содержит ФИО, дату рождения, иногда номер полиса и адрес. Введённое в чат-бот не защищено врачебной тайной: юристы в JAMA разбирали, что переписка с медицинским чат-ботом выпадает из-под законов о защите медицинских данных, действующих для клиник [8]. Российское регулирование персональных данных на иностранные сервисы фактически не распространяется. Перед загрузкой закройте личные данные или перепечатайте цифры текстом.
Что бот делает хорошо и где проверять
| Задача | Как справляется | Что проверить руками |
|---|---|---|
| Объяснить, что означает показатель (для чего ферритин, что такое СОЭ) | Хорошо, лучше форумов [4] | Почти ничего |
| Отметить, какие строки вне референса | Хорошо, если референсы даны [2] | Что взял границы с бланка, а не свои |
| Пересчитать единицы | Приемлемо, если попросить показать расчёт | Коэффициент (глюкоза ×18, холестерин ×38,7, креатинин ×88,4) |
| Оценить, насколько отклонение серьёзно | Слабо [2] | Величину отклонения и сочетание строк |
| Учесть ваш контекст | Только если вы его дали | Пол, возраст, лекарства, беременность, натощак |
| Поставить диагноз | Плохо, особенно скрытые формы [3] | Не заменяется, это врач |
| Сказать, что делать дальше | Слабо, люди с ботом не лучше контроля [1] | Красные флаги и сроки визита |
Как спросить, чтобы ответ был полезным
Работа в Nature Medicine показала, что проваливается не модель, а диалог [1]. Значит, диалог и надо чинить. Рабочий шаблон вопроса:
- Цифры текстом, с единицами и референсами лаборатории: «Ферритин 18 мкг/л (референс 15–150)». Не фото, а текст.
- Контекст в одну строку: пол, возраст, беременность, хронические болезни, все лекарства и добавки, натощак ли, тренировка накануне.
- Просьба перечислить, чего не хватает: «Какой информации тебе недостаёт, чтобы трактовка была надёжной?». Этот вопрос вскрывает пробелы лучше любого другого.
- Нейтральная формулировка: не «это ведь норма?», а «перечисли, что здесь говорит за норму и что против».
- Запрос на степень уверенности: «Отметь, где ты уверен, а где это предположение».
- Запрос сроков: «Есть ли здесь значения, с которыми к врачу нужно сегодня, а не через неделю?».
С таким вопросом чат-бот превращается в подготовку к приёму: вы придёте к врачу с понятными терминами и списком вопросов, а не с тревогой. Как пройти по всем разделам бланка (моча, биохимия, коагулограмма), собрано в навигаторе по анализам.
Когда бот не заменяет врача
Ситуации, в которых объяснение от нейросети не может быть последней инстанцией:
- лаборатория пометила значение как критическое или позвонила сама (калий, глюкоза, гемоглобин, тромбоциты, тропонин, креатинин);
- есть симптомы: одышка, боль в груди, кровотечение, лихорадка, спутанность, резкая слабость;
- показатель ушёл далеко за границу, а не «чуть-чуть»;
- беременность, детский или пожилой возраст, онкологический диагноз;
- результат влияет на решение о лекарстве: начать, отменить, поменять дозу.
Здесь бот годится для одного: сформулировать вопросы к врачу и понять, куда звонить.
Что делать: короткий план
- Закройте ФИО, дату рождения и номер полиса; перепечатайте цифры текстом с единицами и референсами вашей лаборатории.
- Дайте контекст одной строкой: пол, возраст, лекарства, беременность, натощак ли, тренировка накануне.
- Спросите нейтрально и попросите перечислить, чего боту не хватает и где он не уверен.
- Сверьте единицы: если бот ссылается на мг/дл или нмоль/л, потребуйте показать пересчёт.
- Одно отклонение «чуть за границей» без симптомов: пересдать через 2–4 недели в той же лаборатории, а не искать диагноз.
- Критическая пометка лаборатории, симптомы или решение о лекарстве: врач, не чат-бот. Ответ бота берите с собой как список вопросов.
Частые вопросы
Можно ли доверять расшифровке анализов от ChatGPT или DeepSeek?
Как объяснению терминов и первичной сортировке «что вне референса» да. Как оценке серьёзности и диагнозу нет: в проверках боты трактовали лабораторные случаи поверхностно и пропускали скрытые формы болезней, а люди, пользовавшиеся моделями, принимали решения не лучше тех, кто обходился без них.
Почему бот назвал показатель нормальным, а лаборатория подсветила красным?
Чаще всего бот применил чужой референс или другие единицы. Референсные интервалы различаются между лабораториями даже на одинаковых приборах, а глюкоза или витамин D в разных единицах отличаются в разы. Верны только границы и единицы, напечатанные на вашем бланке.
Как правильно задать вопрос нейросети про анализы?
Текстом, а не фото: цифры с единицами и референсами, одна строка контекста (пол, возраст, лекарства, беременность, натощак ли), нейтральная формулировка без подсказки ответа и просьба перечислить, какой информации не хватает и где бот не уверен.
Безопасно ли загружать фото бланка в чат-бот?
Фото содержит персональные данные, а переписка с чат-ботом не защищена врачебной тайной и российским законом о персональных данных на иностранных сервисах. Закройте ФИО, дату рождения и номер полиса или перепечатайте цифры текстом.
Одно отклонение в анализе это уже болезнь?
Нет. Референс покрывает 95% здоровых, поэтому при панели из 20 показателей хотя бы одно значение за границей появляется у здорового человека в большинстве случаев. Врач смотрит на величину отклонения, динамику и сочетание с другими строчками; изолированный небольшой сдвиг без симптомов это повод пересдать, а не диагноз.
⚠ Медицинская оговорка. Материал образовательный, не заменяет консультацию врача. Трактовка результатов анализов зависит от вашей истории, лекарств и симптомов; при критических значениях, отмеченных лабораторией, и при плохом самочувствии обращайтесь к врачу, а не к чат-боту.
Источники
- Bean AM, Payne RE, Parsons G, et al. (2026). Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nat Med, 32(2), 609–615. PubMed: 41663592
- Cadamuro J, Cabitza F, Debeljak Z, et al. (2023). Potentials and pitfalls of ChatGPT and natural-language artificial intelligence models for the understanding of laboratory medicine test results. An assessment by the European Federation of Clinical Chemistry and Laboratory Medicine (EFLM) Working Group on Artificial Intelligence (WG-AI). Clin Chem Lab Med, 61(7), 1158–1166. PubMed: 37083166
- Stevenson E, Walsh C, Hibberd L (2024). Can artificial intelligence replace biochemists? A study comparing interpretation of thyroid function test results by ChatGPT and Google Bard to practising biochemists. Ann Clin Biochem, 61(2), 143–149. PubMed: 37699796
- He Z, Bhasuran B, Jin Q, et al. (2024). Quality of Answers of Generative Large Language Models Versus Peer Users for Interpreting Laboratory Test Results for Lay Patients: Evaluation Study. J Med Internet Res, 26, e56655. PubMed: 38630520
- Kurstjens S, van Dam AD, Oortwijn E, et al. (2025). Inconsistency in ferritin reference intervals across laboratories: a major concern for clinical decision making. Clin Chem Lab Med, 63(3), 600–610. PubMed: 39392623
- Ruzhanskaya A, Ichihara K, Evgina S, et al. (2021). Sources of variation and establishment of Russian reference intervals for major hormones and tumor markers. PLoS One, 16(1), e0234284. PubMed: 33411740
- Chen S, Gao M, Sasse K, et al. (2025). When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior. NPJ Digit Med, 8(1), 605. PubMed: 41107408
- Marks M, Haupt CE (2023). AI Chatbots, Health Privacy, and Challenges to HIPAA Compliance. JAMA, 330(4), 309–310. PubMed: 37410450