Точность ML-модели — переоценённая метрика: уроки Walmart для селлеров

Артем Милосердов из Walmart объясняет, почему 90% точности модели могут принести меньше пользы, чем 70%, и как это связано с продажами на маркетплейсах.

Команда Uniseller · · 5 мин чтения

Пока все обсуждают покупки через ChatGPT, ритейлеры теряют выручку на приёмке и выкладке. Артем Милосердов, Senior Product Manager в Walmart, отвечает за ML-платформу In-Stock Assistant, которая управляет доступностью товара примерно в 10 тыс. магазинов по всему миру. В августе он вошел в число 30 победителей международной премии Product Builder Awards 2026. Его опыт полезен и селлерам: те же принципы работают при управлении остатками на маркетплейсах.

#Что нового в американских системах управления полкой

Ритейлеры в России и США давно используют прогнозирование спроса, автозаказ и компьютерное зрение. Принципиальное отличие — система сама управляет процессом: платформа In-Stock Assistant не просто находит пустую полку, а говорит сотруднику, что именно сделать. Если остаток ненулевой, а продажи упали до нуля, система сопоставляет движение запасов и историю приёмки, чтобы найти фантомный остаток.

В США рынок смещается к платформенности: отдельные инструменты объединяют в одно приложение. Доставка дронами, динамические цены и ИИ-ассистенты — уже текущая практика. Walmart вместе с Wing выполнил больше миллиона доставок дронами.

  • In-Stock Assistant — управляет доступностью товара в 10 тыс. магазинов
  • Walmart + Wing — более 1 млн доставок дронами
  • Product Builder Awards 202630 победителей из 5 тыс. номинантов

Эти технологии дают измеримый эффект уже на пилотах.

#Российский ритейл отстаёт не в технологиях

Разница — в бизнес-процессах. Российская розница технологически развита: крупные сети автоматизируют прогнозы, логистику и цены. Компании быстрее проходят путь от идеи до пилота и охотнее запускают неидеальные решения — из-за конкуренции, дефицита персонала и давления на операционную эффективность.

Сильная сторона американских корпораций — дисциплина масштабирования: контрольные группы, единые платформы, безопасность. В России из-за требований к скорости пилот нередко масштабируют сразу на всю сеть, что повышает риск провала.

Точность модели — самая переоценённая метрика в ритейле. Экономический результат — это цепочка: точность нужно умножить на долю сигналов, дошедших до сотрудника, долю задач, выполненных вовремя, и долю действий, выполненных правильно.

Модель с точностью 90%, которой следуют в 20% случаев, может принести меньше пользы, чем модель с точностью 70% и следованием в 90% случаев.

#Почему пилоты разваливаются при масштабировании

В пилоте есть проектная команда, которая чистит данные и быстро отвечает на вопросы. При масштабировании выясняется, что отличаются оборудование, регламенты, привычки директоров. Вторая причина — сто отдельных пилотов не складываются в платформу. Американские корпорации инвестируют в платформенную дисциплину, и в перспективе интеграция идёт быстрее.

#Как In-Stock Assistant ранжирует задачи

Классическое машинное обучение помогает определить, какой грузовик разгружать первым, какую палету открыть в приоритетном порядке. Система учитывает пробелы на полке, состав поставки, историю расхождений, сезонность и скорость продаж. Бизнес-эффект зависит не от количества найденных аномалий, а от того, какие из них сотрудник успеет исправить.

В магазине можно обнаружить сотни отклонений, но внимание линейного персонала ограничено. Если показать человеку все, он либо не выполнит ничего, либо выберет задачи случайно. Поэтому система ранжирует задачи по ожидаемому экономическому эффекту: потенциальной потерянной выручке, скорости продаж, вероятности дефицита и времени на исправление.

  1. Проверить конкретный товар
  2. Вынести его из подсобки
  3. Подтвердить расхождение
  4. Исправить ценник

ИИ против менеджера, а не создавать ещё один экран с сотней уведомлений. Поэтому точность модели — переоценённая метрика.

#Что добавляет генеративный ИИ

Классический ML решает, куда смотреть. Генеративный ИИ меняет способ взаимодействия сотрудника с системой. На приёмке это особенно важно: у человека заняты руки, ему неудобно переключаться между приложениями и искать регламенты.

Сотрудник фотографирует повреждённую палету — система распознаёт товар, извлекает данные, создаёт запись о расхождении и готовит черновик претензии поставщику. Другой сценарий — голосовой вопрос: «Что делать, если срок годности короче нормы?» Система находит пункт регламента и предлагает решение. Она также может объяснить, почему конкретная палета получила высокий приоритет.

#Как определить, что ИИ можно доверить самостоятельно

Главный критерий — обратимость. ИИ может выполнять действия, которые легко отменить: расставлять приоритеты задач, прогнозировать дефицит, предлагать очерёдность пополнения полок. Чем ближе решение к деньгам, юридическим последствиям и безопасности, тем больше контроля. почему алгоритм не всегда прав.

Лучший результат даёт схема, при которой ИИ принимает тысячи небольших операционных решений, а сотрудник подтверждает только важные исключения.

#Где подход особенно востребован в России

В сегменте готовой еды много сложных факторов: скоропорт, нестабильный спрос, быстрое изменение цен. Ошибка ударит по марже уже к концу дня. Система должна быстро считывать сигналы и давать команды изменить объём производства, ускорить выкладку или вовремя применить уценку.

#Что проверить до запуска ИИ-пилота

Задайте себе вопросы: какую конкретно операцию мы улучшаем? Доступны ли все необходимые данные? Сколько стоит ложная тревога и сколько — пропущенная проблема? Можно ли отменить действие, если система ошиблась? И как эффект дойдёт до P&L? ИИ-проекты, которые провалились, а дорогостоящее исследование.

После запуска важно измерять эффективность. Лучший способ — сравнивать идентичные магазины, где ИИ работал и где нет. Сезонность, акции и внешние факторы искажают результат. Поэтому нужны контрольные группы.

#Что это значит для селлеров

Принципы Walmart применимы и к продажам на маркетплейсах. Вместо погони за точностью прогноза анализируйте, как рекомендации доходят до действия: доля выполненных задач, скорость реакции, влияние на доступность товара. Настройте контрольные группы для оценки эффекта от изменений. Если внедряете ИИ-инструменты, проверяйте их по критерию обратимости и влиянию на P&L. Такой подход снижает риски и повышает продажи.

Uniseller

Управляйте продажами на маркетплейсах с одной платформы

Wildberries, Ozon, Яндекс Маркет в одном кабинете. Аналитика, остатки, цены, ответы на отзывы.

Попробовать бесплатно

Источники

Лучшие статьи о маркетплейсах — раз в неделю

Свежие и популярные материалы блога. Без спама, отписка в один клик.