«Платформа ОФД» представила технологию потоковой обработки коротких текстов

IT-компания «Платформа ОФД» представила ноу-хау – технологию обработки коротких текстов с опечатками, ошибками и сокращениями, которые встречаются в кассовых чеках. Разработка крупнейшего оператора фискальных данных, входящего в экосистему Сбера, уже внедрена в работу и ежедневно распознает информацию из 48 млн кассовых чеков. Решение разработано на базе анализа более 55 миллиардов фискальных документов, которые накоплены за 5 лет работы компании с агрегированными обезличенными данными. Потоковая обработка коротких текстов позволяет точно определять и идентифицировать товары и категории, указанные в чеках с кассовых устройств. Процесс распознавания происходит в режиме реального времени, позволяя в «потоке» документов скоростью более 1 000 транзакций в секунду - классифицировать, сравнивать и верифицировать товарные записи, в том числе содержащие различные ошибки и неполные данные.

Часто в чеках встречается короткое наименование товара и его характеристик, либо в названии допущены ошибки или опечатки. Это связано с ограничениями по объему символов в строках фискальных документах, которые выдаются покупателю. Другая причина – пресловутый человеческий фактор. Благодаря технологиям Machine Learning и накопленной за несколько лет экспертизе в данных, мы научили нейросети нашей системы четко, оперативно, с минимум погрешностей – распознавать и анализировать поступающую информацию.Сегодня такая потоковая обработка охватывает до 21 миллиона товаров (SKU) из 3,5 тыс. категорий, с 6 уровнями вложенности

Алексей Баров

Генеральный директор IT-компании «Платформа ОФД»

База для работы с короткими текстами «Платформы ОФД» сейчас включает 5 млрд уникальных записей товаров, 150 млн написаний товаров в день. На потоке определяется более 3 млн брендов. При этом данные для классификации агрегируются как из чеков, так и из свободного доступа (отраслевые классификаторы/ каталоги с сайтов ретейлеров/ данные маркировки). Ноу-хау помогло выявить, какова доля чеков с сокращениями и ошибками. По оценкам «Платформы ОФД», грамматические ошибки, опечатки и сокращения ежедневно допускаются в 60-65% всех чеков из продуктовой розничной торговли. При этом еще два года назад этот показатель был на уровне 80-85%.

IT-компания «Платформа ОФД» - оператор фискальных данных (ОФД), электронного документооборота (ЭДО) и электронной отчетности. Компания ежедневно обрабатывает и передает в ФНС и оператору системы маркировки товаров ЦРПТ свыше 48 млн кассовых чеков. Развивает сервисы для предпринимателей, бухгалтерии, менеджеров.№1 в рейтинге российских ОФД по версии CNews Analytics. Входит в экосистему Сбера. Официальный сайт — platformaofd.ru