Все материалы
AIкейссредний

Нейросеть для анализа данных: эксперимент на 548 рейсах

Проверили четыре нейросети на таблице рейсов с известными ответами: ответ текстом, SQL и код на Python. Какая нейросеть лучше для анализа данных и как её проверить.

КейсПрактика26 сентября 2026 г.11 мин

Вопрос «какая нейросеть лучше для анализа данных» обычно разбирают списком сервисов с описаниями из их же рекламы. Мы сделали по-другому: взяли таблицу, в которой каждый ответ известен заранее, и задали одни и те же вопросы четырём моделям OpenAI — по три раза каждой. Модели считали тремя способами: в уме по вставленной таблице, запросом SQL по схеме базы и кодом на Python. Разница между способами оказалась намного больше, чем разница между моделями. Ниже — цифры, ошибки и то, как повторить такую проверку на своих данных.

Результаты в одном абзаце

  • Ответ текстом по таблице из 548 строк: от 22 до 48% верных ответов в зависимости от модели. Суммарную выручку точно не назвала ни одна модель ни в одном из 12 прогонов.
  • SQL-запрос по схеме базы, который мы выполнили сами: от 81 до 100% верных результатов.
  • Та же таблица, но модель пишет и выполняет Python: с загруженным файлом — 99 верных ответов из 108, единственный сбой — прогон, оборвавшийся без ответа. Вставленную текстом таблицу модель переписывает в код и иногда теряет строки.
  • Ошибки выглядят одинаково уверенно: аккуратный JSON, ни одной оговорки, что число — оценка.
  • Для любой цифры, которая пойдёт в отчёт, нужен код, который вы видите и можете запустить. Модель стоит выбирать уже после этого.

Как мы проверяли

Данные — учебная база «Авиаперевозки», на которой работает наш тренажёр SQL. Для первой и третьей части мы выгрузили рейсы за 5 августа 2026 года: 548 строк с номером рейса, аэропортами, временем вылета, статусом, кодом самолёта, числом пассажиров и выручкой. CSV-таблица занимает около 23 тысяч символов — примерно столько человек вставляет в чат, когда просит «посчитай по выгрузке».

Модели: GPT-5.5, GPT-5.4 mini, GPT-4.1 mini и GPT-4o через API OpenAI, с настройками по умолчанию. Каждое задание — трижды, потому что модель на одном и том же вопросе может ответить по-разному. Ответ засчитывали с допуском: суммы — в пределах 0,5%, медиана — 1%, доли — 0,2 процентного пункта. Это мягче, чем требует отчёт, где сумма должна сходиться до рубля.

Честное ограничение: в этой версии только модели OpenAI. Claude, GigaChat, YandexGPT и DeepSeek мы добавим, когда подключим их API, — задания и эталоны готовы. И API — не то же самое, что веб-чат: в чате у модели по умолчанию может быть включено выполнение кода, и ответ будет ближе к третьей части эксперимента, чем к первой.

Вопросы первой части и верные ответы
ВопросВерный ответ
Сколько рейсов в таблице548
Суммарная выручка438 406 200 ₽
Среднее число пассажиров на рейс40,2
Сколько рейсов отменено2
Три аэропорта с наибольшим числом вылетовDME и SVO (по 49), LED (33)
Доля вылетов из Шереметьево8,9%
Медианная выручка рейса209 750 ₽
Какой самолёт принёс больше всего выручкиSU9 (Суперджет)
Сколько он принёс102 548 100 ₽

Часть 1. Модель считает в уме

Здесь модель получала таблицу текстом и должна была ответить сразу, без выполнения кода. Так работает любой чат, если просто вставить в него выгрузку.

Все модели почти всегда верно называли число строк и число отмен. Чаще, чем другие, угадывали самолёт-лидер и тройку аэропортов. Но всё, что требует сложить, усреднить или упорядочить сотни чисел, ломалось у всех. Лучшая модель, GPT-5.5, ответила верно на 13 вопросов из 27, худшая — на 6.

Верные ответы без выполнения кода: 9 вопросов × 3 прогона
МодельВерноДоля
GPT-5.513 из 2748%
GPT-4.1 mini10 из 2737%
GPT-5.4 mini8 из 2730%
GPT-4o6 из 2722%

Сколько заработала авиакомпания: 12 разных ответов

Самый наглядный вопрос — суммарная выручка. Верный ответ — 438 406 200 ₽. Модели дали двенадцать разных чисел: три ответа промахнулись меньше чем на процент, остальные — от 2,8% до ошибки в 4,7 раза. Самый маленький ответ — 106 млн, самый большой — 2,04 млрд. Одна и та же модель в трёх прогонах называла 276 млн, 1,57 млрд и 2,04 млрд рублей.

Медиану выручки не угадал никто: ответы разошлись от 44 100 до 540 000 ₽ при верных 209 750. Медиана требует упорядочить все 548 значений и найти середину — ровно то, чего языковая модель не делает, когда предсказывает текст.

Ответы моделей на вопрос о суммарной выручке, млн ₽

Первая строка — верный ответ, 438,4 млн ₽. Дальше двенадцать ответов: модель и номер прогона, по возрастанию.

Выручка, млн ₽

Почему ломаются именно суммы и медианы

Ошибки в первой части распределились не случайно. Вопросы, на которые можно ответить, посмотрев на таблицу, — сколько строк, есть ли отмены — модели решали почти всегда. Вопросы, где нужно пройти по всем строкам и сложить или упорядочить значения, не решались почти никогда.

Языковая модель не хранит таблицу как массив чисел и не складывает их по одному. Она видит текст и предсказывает правдоподобное продолжение — в том числе правдоподобное число. Когда в таблице десять строк, правдоподобное и верное часто совпадают. Когда строк 548, модель улавливает порядок величин и характер данных, но не сумму. Отсюда разброс в разы и то, что одна и та же модель в трёх попытках называет три разных числа.

Доля вылетов из Шереметьево показывает то же самое с другой стороны. Считать нужно всего одну категорию, но по всем 548 строкам. Верно её назвала только GPT-5.5, и только в одном прогоне из трёх. Остальные ответы разошлись от 8,2 до 19,2% при верных 8,9%.

Верные ответы по типам вопросов, все модели вместе (12 прогонов)
Тип вопросаПримерВерно
Посчитать строкиСколько рейсов11 из 12
Посчитать по условиюСколько отмен11 из 12
Найти лидераКакой самолёт принёс больше всего7 из 12
Упорядочить группыТри аэропорта с наибольшим числом вылетов5 из 12
СреднееПассажиров на рейс1 из 12
ДоляВылеты из Шереметьево1 из 12
СуммаВыручка за день; выручка самолёта-лидера1 из 24
МедианаМедианная выручка рейса0 из 12

Часть 2. Модель пишет SQL, база считает

Во второй части модели получали не данные, а схему базы — восемь таблиц со столбцами — и задачу словами. Мы выполняли запрос и сравнивали результат с эталоном. Задач было 14: от «сколько аэропортов в Москве» до «сколько пассажиров летали в августе, но не летали в июле». Несколько задач содержали ловушки, в которые часто попадают и люди: соединение таблиц, которое размножает строки, город, записанный по-русски, условие «хотя бы один».

Три задачи допускали вторую разумную трактовку — например, включать ли в отчёт модель самолёта без рейсов или считать «летавших» по посадочным талонам, а не по купленным билетам. Такие ответы мы засчитывали.

Верные запросы: 14 задач × 3 прогона
МодельВерноДоляТипичная ошибка
GPT-5.542 из 42100%—
GPT-5.4 mini41 из 4298%места и талоны в одном JOIN — загрузка 68,5% вместо 35,1%
GPT-4.1 mini36 из 4286%«Moscow» вместо «Москва»; выдуманные столбцы
GPT-4o34 из 4281%JOIN, который раздувает средний чек: 141 063 ₽ вместо 125 745 ₽
Почему SQL надёжнее

Запрос выполняет база, и сложение там безошибочно. Ошибка переезжает из арифметики в логику — а логику видно в тексте запроса. Разбор ошибок и как их ловить — в статье про нейросеть для SQL.

Часть 3. Модель пишет и выполняет код

В третьей части модели разрешили писать и выполнять Python — так работает режим анализа данных в чат-ботах. Мы проверили два способа передать таблицу: вставить её текстом в запрос, как в первой части, и загрузить файлом, как делают, когда прикладывают выгрузку к чату.

С файлом три модели ответили верно на все 27 вопросов. GPT-4.1 mini в одном прогоне споткнулась о собственный код — ошибку при выводе результата — и закончила ответ обещанием «сейчас исправлю»; два других прогона прошли без ошибок. Со вставленной таблицей всё зависело от серии. В одной все модели ответили верно, в другой GPT-5.5 ошиблась в 13 ответах из 27: в одном прогоне в её таблице оказалось 430 строк вместо 548, в другом — 546. Причина видна в коде. Вставленную таблицу модель переписывает в программу строковой константой длиной 23 тысячи символов и может потерять или исказить строки по дороге. Из файла код читает данные напрямую, и такой ошибки не возникает.

Верные ответы, когда модель выполняет Python: 9 вопросов
МодельТаблица вставлена текстом, 6 прогоновТаблица загружена файлом, 3 прогона
GPT-5.541 из 5427 из 27
GPT-5.4 mini54 из 5427 из 27
GPT-4.1 mini54 из 5418 из 27 — один прогон без ответа
GPT-4o54 из 5427 из 27

Какая нейросеть лучше для анализа данных

Если отвечать на этот вопрос по нашим цифрам, то в ответе текстом и в SQL лидировала GPT-5.5, а GPT-4o, которую многие до сих пор используют по привычке, была последней. Но в третьей части именно GPT-5.5 теряла строки, переписывая вставленную таблицу. Главный вывод другой. Худший способ с лучшей моделью — ответ текстом у GPT-5.5 — дал 48% верных ответов. Лучший способ со слабой моделью — SQL от GPT-4o — дал 81%, а Python по загруженному файлу у той же GPT-4o — все 27 из 27.

Поэтому выбирать стоит в таком порядке. Сначала — способ: модель должна писать код, а вы — видеть его и результат. Потом — место: подключается ли инструмент к вашим данным, можно ли туда отправлять эти данные по правилам компании. И только потом — модель внутри: новые модели ошибаются реже, особенно в запросах с ловушками.

  • Для цифры в отчёт: SQL или Python, который выполняется у вас или в инструменте с видимым кодом.
  • Для прикидки «какой порядок чисел»: ответ текстом допустим, но как гипотеза.
  • Для разметки текстов, резюме, формулировок: здесь языковая модель сильна и без кода.

Как проверить нейросеть на своих данных

Результаты на авиаперевозках не обязательно перенесутся на ваши таблицы: у вас другие названия, другие ловушки, другая модель в чате. Повторить проверку можно за вечер.

  • Возьмите реальную таблицу, по которой у вас уже есть верные цифры из отчёта или базы.
  • Составьте 8–10 вопросов: пару простых (число строк), пару сумм и средних, медиану или процентиль, долю, топ по группе.
  • Задайте их выбранной нейросети тем способом, которым вы будете работать: вставкой текста, загрузкой файла, через SQL.
  • Повторите трижды: разброс ответов важнее одного удачного ответа.
  • Сравните с верными цифрами с допуском, который нужен вашему отчёту.
  • Запишите ошибки и добавьте в свой шаблон промпта то, чего модели не хватало.

Что почитать дальше

Статьи полки разбирают отдельные инструменты. Если результат SQL-части кажется слишком хорошим, посмотрите разбор ошибок: они простые, но опасные.

Продолжить чтение
Вся библиотека