Введение. Большие языковые модели (БЯМ) – программы на основе искусственного интеллекта, обученные на массивах текстовых данных и способные генерировать связные текстовые ответы на произвольные запросы – за последние два года совершили революцию в информационном взаимодействии во многих областях, включая медицину. Однако урология представляет особый вызов для БЯМ по нескольким причинам: узкоспециализированная терминология, многообразие клинических сценариев, необходимость учета актуальных клинических рекомендаций и высокая значимость точных числовых данных.
Цель. Оценить клиническую точность и безопасность 18 БЯМ при ответах на вопросы по урологии и сравнить их с системой генерации с дополненной выборкой (RAG), основанной на верифицированной доказательной базе знаний.
Материалы и методы. Проспективное сравнительное исследование включало два направления: оценку фактической точности 17 БЯМ на 28 специфических вопросах по урологии с верифицированными эталонными ответами (115 фактов, допустимое отклонение 2%); клиническую оценку 18 БЯМ на 120 клинических случаях из реальных консультаций в сравнении с эталонными ответами врача-уролога. Модели стратифицированы по 4 уровням: флагманские (Уровень 1, n=7), сильные (Уровень 2, n=4), открытые (Уровень 3, n=4) и компактные (Уровень 4, n=3). RAG-система: Qwen3-80B + векторная база данных (2,23 млн фрагментов, 17 947 документов, 19 доменов). Оценка качества выполнена с помощью метода «языковая модель как эксперт» (Gemini 2.5 Flash), 2260 клинических оценок. Статистический анализ: дисперсионный анализ (ANOVA), критерий Cohen's d, 95% доверительные интервалы.
Результаты. RAG превзошла все «чистые» БЯМ по точности: 4,83 vs 4,09 балла (лучшая модель, Claude Opus 4.6), Cohen's d = 1,05 (p<0,001). Различия между Уровнями 1, 2 и 3 статистически незначимы (Cohen's d=0,07–0,15), тогда как Уровень 4 показал клинически неприемлемую точность (2,52/5). Наибольший эффект RAG достигнут при онкоурологии (Δ=+1,47–1,89) и хирургических методиках (Δ=+1,77). Все «чистые» БЯМ продемонстрировали значительное число проблем безопасности (0,85–3,09 на кейс), при этом эмпатия оставалась стабильно высокой (4,18–4,85), создавая у пациента ложное ощущение компетентности.
Заключение. «Чистые» БЯМ всех уровней демонстрируют высокий уровень галлюцинаций в клинической урологии. RAG-система устраняет этот недостаток с большим эффектом. Флагманский статус модели не гарантирует клинической точности. RAG является перспективной архитектурой для систем поддержки принятия врачебных решений в урологии.

