Нейросеть для анализа данных: эксперимент на 548 рейсах
Проверили четыре нейросети на таблице рейсов с известными ответами: ответ текстом, SQL и код на Python. Какая нейросеть лучше для анализа данных и как её проверить.
Содержание статьи
Вопрос «какая нейросеть лучше для анализа данных» обычно разбирают списком сервисов с описаниями из их же рекламы. Мы сделали по-другому: взяли таблицу, в которой каждый ответ известен заранее, и задали одни и те же вопросы четырём моделям OpenAI — по три раза каждой. Модели считали тремя способами: в уме по вставленной таблице, запросом SQL по схеме базы и кодом на Python. Разница между способами оказалась намного больше, чем разница между моделями. Ниже — цифры, ошибки и то, как повторить такую проверку на своих данных.
Результаты в одном абзаце
- Ответ текстом по таблице из 548 строк: от 22 до 48% верных ответов в зависимости от модели. Суммарную выручку точно не назвала ни одна модель ни в одном из 12 прогонов.
- SQL-запрос по схеме базы, который мы выполнили сами: от 81 до 100% верных результатов.
- Та же таблица, но модель пишет и выполняет Python: с загруженным файлом — 99 верных ответов из 108, единственный сбой — прогон, оборвавшийся без ответа. Вставленную текстом таблицу модель переписывает в код и иногда теряет строки.
- Ошибки выглядят одинаково уверенно: аккуратный JSON, ни одной оговорки, что число — оценка.
- Для любой цифры, которая пойдёт в отчёт, нужен код, который вы видите и можете запустить. Модель стоит выбирать уже после этого.
Как мы проверяли
Данные — учебная база «Авиаперевозки», на которой работает наш тренажёр SQL. Для первой и третьей части мы выгрузили рейсы за 5 августа 2026 года: 548 строк с номером рейса, аэропортами, временем вылета, статусом, кодом самолёта, числом пассажиров и выручкой. CSV-таблица занимает около 23 тысяч символов — примерно столько человек вставляет в чат, когда просит «посчитай по выгрузке».
Модели: GPT-5.5, GPT-5.4 mini, GPT-4.1 mini и GPT-4o через API OpenAI, с настройками по умолчанию. Каждое задание — трижды, потому что модель на одном и том же вопросе может ответить по-разному. Ответ засчитывали с допуском: суммы — в пределах 0,5%, медиана — 1%, доли — 0,2 процентного пункта. Это мягче, чем требует отчёт, где сумма должна сходиться до рубля.
Честное ограничение: в этой версии только модели OpenAI. Claude, GigaChat, YandexGPT и DeepSeek мы добавим, когда подключим их API, — задания и эталоны готовы. И API — не то же самое, что веб-чат: в чате у модели по умолчанию может быть включено выполнение кода, и ответ будет ближе к третьей части эксперимента, чем к первой.
| Вопрос | Верный ответ |
|---|---|
| Сколько рейсов в таблице | 548 |
| Суммарная выручка | 438 406 200 ₽ |
| Среднее число пассажиров на рейс | 40,2 |
| Сколько рейсов отменено | 2 |
| Три аэропорта с наибольшим числом вылетов | DME и SVO (по 49), LED (33) |
| Доля вылетов из Шереметьево | 8,9% |
| Медианная выручка рейса | 209 750 ₽ |
| Какой самолёт принёс больше всего выручки | SU9 (Суперджет) |
| Сколько он принёс | 102 548 100 ₽ |
Часть 1. Модель считает в уме
Здесь модель получала таблицу текстом и должна была ответить сразу, без выполнения кода. Так работает любой чат, если просто вставить в него выгрузку.
Все модели почти всегда верно называли число строк и число отмен. Чаще, чем другие, угадывали самолёт-лидер и тройку аэропортов. Но всё, что требует сложить, усреднить или упорядочить сотни чисел, ломалось у всех. Лучшая модель, GPT-5.5, ответила верно на 13 вопросов из 27, худшая — на 6.
| Модель | Верно | Доля |
|---|---|---|
| GPT-5.5 | 13 из 27 | 48% |
| GPT-4.1 mini | 10 из 27 | 37% |
| GPT-5.4 mini | 8 из 27 | 30% |
| GPT-4o | 6 из 27 | 22% |
Сколько заработала авиакомпания: 12 разных ответов
Самый наглядный вопрос — суммарная выручка. Верный ответ — 438 406 200 ₽. Модели дали двенадцать разных чисел: три ответа промахнулись меньше чем на процент, остальные — от 2,8% до ошибки в 4,7 раза. Самый маленький ответ — 106 млн, самый большой — 2,04 млрд. Одна и та же модель в трёх прогонах называла 276 млн, 1,57 млрд и 2,04 млрд рублей.
Медиану выручки не угадал никто: ответы разошлись от 44 100 до 540 000 ₽ при верных 209 750. Медиана требует упорядочить все 548 значений и найти середину — ровно то, чего языковая модель не делает, когда предсказывает текст.
Первая строка — верный ответ, 438,4 млн ₽. Дальше двенадцать ответов: модель и номер прогона, по возрастанию.
Почему ломаются именно суммы и медианы
Ошибки в первой части распределились не случайно. Вопросы, на которые можно ответить, посмотрев на таблицу, — сколько строк, есть ли отмены — модели решали почти всегда. Вопросы, где нужно пройти по всем строкам и сложить или упорядочить значения, не решались почти никогда.
Языковая модель не хранит таблицу как массив чисел и не складывает их по одному. Она видит текст и предсказывает правдоподобное продолжение — в том числе правдоподобное число. Когда в таблице десять строк, правдоподобное и верное часто совпадают. Когда строк 548, модель улавливает порядок величин и характер данных, но не сумму. Отсюда разброс в разы и то, что одна и та же модель в трёх попытках называет три разных числа.
Доля вылетов из Шереметьево показывает то же самое с другой стороны. Считать нужно всего одну категорию, но по всем 548 строкам. Верно её назвала только GPT-5.5, и только в одном прогоне из трёх. Остальные ответы разошлись от 8,2 до 19,2% при верных 8,9%.
| Тип вопроса | Пример | Верно |
|---|---|---|
| Посчитать строки | Сколько рейсов | 11 из 12 |
| Посчитать по условию | Сколько отмен | 11 из 12 |
| Найти лидера | Какой самолёт принёс больше всего | 7 из 12 |
| Упорядочить группы | Три аэропорта с наибольшим числом вылетов | 5 из 12 |
| Среднее | Пассажиров на рейс | 1 из 12 |
| Доля | Вылеты из Шереметьево | 1 из 12 |
| Сумма | Выручка за день; выручка самолёта-лидера | 1 из 24 |
| Медиана | Медианная выручка рейса | 0 из 12 |
Часть 2. Модель пишет SQL, база считает
Во второй части модели получали не данные, а схему базы — восемь таблиц со столбцами — и задачу словами. Мы выполняли запрос и сравнивали результат с эталоном. Задач было 14: от «сколько аэропортов в Москве» до «сколько пассажиров летали в августе, но не летали в июле». Несколько задач содержали ловушки, в которые часто попадают и люди: соединение таблиц, которое размножает строки, город, записанный по-русски, условие «хотя бы один».
Три задачи допускали вторую разумную трактовку — например, включать ли в отчёт модель самолёта без рейсов или считать «летавших» по посадочным талонам, а не по купленным билетам. Такие ответы мы засчитывали.
| Модель | Верно | Доля | Типичная ошибка |
|---|---|---|---|
| GPT-5.5 | 42 из 42 | 100% | — |
| GPT-5.4 mini | 41 из 42 | 98% | места и талоны в одном JOIN — загрузка 68,5% вместо 35,1% |
| GPT-4.1 mini | 36 из 42 | 86% | «Moscow» вместо «Москва»; выдуманные столбцы |
| GPT-4o | 34 из 42 | 81% | JOIN, который раздувает средний чек: 141 063 ₽ вместо 125 745 ₽ |
Запрос выполняет база, и сложение там безошибочно. Ошибка переезжает из арифметики в логику — а логику видно в тексте запроса. Разбор ошибок и как их ловить — в статье про нейросеть для SQL.
Часть 3. Модель пишет и выполняет код
В третьей части модели разрешили писать и выполнять Python — так работает режим анализа данных в чат-ботах. Мы проверили два способа передать таблицу: вставить её текстом в запрос, как в первой части, и загрузить файлом, как делают, когда прикладывают выгрузку к чату.
С файлом три модели ответили верно на все 27 вопросов. GPT-4.1 mini в одном прогоне споткнулась о собственный код — ошибку при выводе результата — и закончила ответ обещанием «сейчас исправлю»; два других прогона прошли без ошибок. Со вставленной таблицей всё зависело от серии. В одной все модели ответили верно, в другой GPT-5.5 ошиблась в 13 ответах из 27: в одном прогоне в её таблице оказалось 430 строк вместо 548, в другом — 546. Причина видна в коде. Вставленную таблицу модель переписывает в программу строковой константой длиной 23 тысячи символов и может потерять или исказить строки по дороге. Из файла код читает данные напрямую, и такой ошибки не возникает.
| Модель | Таблица вставлена текстом, 6 прогонов | Таблица загружена файлом, 3 прогона |
|---|---|---|
| GPT-5.5 | 41 из 54 | 27 из 27 |
| GPT-5.4 mini | 54 из 54 | 27 из 27 |
| GPT-4.1 mini | 54 из 54 | 18 из 27 — один прогон без ответа |
| GPT-4o | 54 из 54 | 27 из 27 |
Какая нейросеть лучше для анализа данных
Если отвечать на этот вопрос по нашим цифрам, то в ответе текстом и в SQL лидировала GPT-5.5, а GPT-4o, которую многие до сих пор используют по привычке, была последней. Но в третьей части именно GPT-5.5 теряла строки, переписывая вставленную таблицу. Главный вывод другой. Худший способ с лучшей моделью — ответ текстом у GPT-5.5 — дал 48% верных ответов. Лучший способ со слабой моделью — SQL от GPT-4o — дал 81%, а Python по загруженному файлу у той же GPT-4o — все 27 из 27.
Поэтому выбирать стоит в таком порядке. Сначала — способ: модель должна писать код, а вы — видеть его и результат. Потом — место: подключается ли инструмент к вашим данным, можно ли туда отправлять эти данные по правилам компании. И только потом — модель внутри: новые модели ошибаются реже, особенно в запросах с ловушками.
- Для цифры в отчёт: SQL или Python, который выполняется у вас или в инструменте с видимым кодом.
- Для прикидки «какой порядок чисел»: ответ текстом допустим, но как гипотеза.
- Для разметки текстов, резюме, формулировок: здесь языковая модель сильна и без кода.
Как проверить нейросеть на своих данных
Результаты на авиаперевозках не обязательно перенесутся на ваши таблицы: у вас другие названия, другие ловушки, другая модель в чате. Повторить проверку можно за вечер.
- Возьмите реальную таблицу, по которой у вас уже есть верные цифры из отчёта или базы.
- Составьте 8–10 вопросов: пару простых (число строк), пару сумм и средних, медиану или процентиль, долю, топ по группе.
- Задайте их выбранной нейросети тем способом, которым вы будете работать: вставкой текста, загрузкой файла, через SQL.
- Повторите трижды: разброс ответов важнее одного удачного ответа.
- Сравните с верными цифрами с допуском, который нужен вашему отчёту.
- Запишите ошибки и добавьте в свой шаблон промпта то, чего модели не хватало.
Что почитать дальше
Статьи полки разбирают отдельные инструменты. Если результат SQL-части кажется слишком хорошим, посмотрите разбор ошибок: они простые, но опасные.
Материалы по теме

Как писать промпты: шаблоны для работы с данными
Как составить промпт для аналитической задачи: шесть обязательных частей, пример до и после, 18 шаблонов для SQL, Python, Excel, разметки и отчётов.

ИИ в работе аналитика: где нейросеть помогает, а где врёт
Как аналитику работать с нейросетями: какие задачи ИИ ускоряет, где выдумывает цифры, как ставить задачу и проверять ответ. С результатами нашего эксперимента.
Собеседование аналитика данных: 30 задач и как решать их вслух
Большой практический гайд по собеседованию аналитика данных: SQL, Python, метрики, статистика, кейсы, дашборды и ответы, которые показывают ход мышления.