DATA Foundation и Trace: зачем ИИ-лабораториям блокчейн-квитанция на каждый обучающий файл
25 июня 2026 года протокол Story объявил о ребрендинге в The DATA Foundation (DATA) и запустил DATA Network — инфраструктуру, заточенную под один конкретный рынок: данные для обучения искусственного интеллекта. Токен $IP, на котором строилась предыдущая версия протокола, конвертировался в $DATA. Вместе с ребрендингом на сеть подключили Kled — по заявлению команды, крупнейший маркетплейс данных, работающий по модели opt-in (пользователи сами соглашаются продавать свои данные), и сразу зарегистрировали на платформе 1,5 миллиарда пользовательских записей. Возглавила фонд Андреа Муттони (Andrea Muttoni) в роли CEO, а основатель Kled Ави Патель (Avi Patel) занял позицию Chief Data Officer.
Ключевой продукт запуска — Trace, публичный аудиторский слой поверх DATA Network. Формально это не новая экосистема с нуля, а логичное продолжение того, чем Story занимался и раньше: токенизацией интеллектуальной собственности и провенансом (доказуемым происхождением) цифровых активов. Просто теперь фокус сузили до одной болевой точки — обучающих датасетов для ИИ.
Почему это важно
Последние пару лет индустрия ИИ упирается в дефицит качественных данных. Открытый интернет как источник текста, изображений и голоса для обучения моделей практически исчерпан — а то, что осталось, всё чаще прикрыто исками об авторских правах: крупные лаборатории один за другим оказываются в судах из-за того, что скрейпили контент без согласия правообладателей. Одновременно растёт спрос на данные, которые скрейпингом в принципе не собрать: экспертную разметку, диалоги, голосовые образцы, специализированные датасеты по медицине или праву.
В этой ситуации у лабораторий появляется новая головная боль: даже если данные куплены легально, доказать это регулятору, партнёру или суду часто нечем. Нет единого стандарта, который бы фиксировал, кто дал согласие на использование, на каких условиях, и была ли произведена оплата. DATA Foundation предлагает закрыть именно этот пробел — сделать происхождение данных таким же проверяемым активом, как транзакция в блокчейне.
Как это устроено технически
Когда контрибьютор загружает данные через любое приложение внутри DATA Network, в блокчейн вместе с самим файлом попадает не сам контент, а его цифровой след — шесть параметров: хэш содержимого, подписанное согласие на использование, версионированные условия лицензии, статус оплаты, данные о комплаенсе и полный лог жизненного цикла записи (кто и когда с ней что делал).
Принципиальный момент — асимметрия доступа. Саму запись (фото, голосовой сэмпл, размеченный текст) увидеть нельзя: файл остаётся конфиденциальным. А вот доказательство того, что с ним происходило — можно, причём всем сторонам сразу: ИИ-лаборатории, которая покупает датасет, самому контрибьютору, чьи данные использовали, и в теории даже регулятору. По архитектуре Trace группирует квитанции в Merkle-дерево и фиксирует корень дерева в блокчейне через протокол DATA Foundation, а дальнейшие события — обновления метаданных, смена статуса оплаты и так далее — довешиваются к этой записи по мере жизни датасета.
Как этим пользуется ИИ-лаборатория
На практике рабочий процесс лаборатории через Trace выглядит примерно так: сначала ты ищешь по реестру — по приложению-источнику, типу данных (модальности), временному диапазону; затем сужаешь выборку под конкретную задачу; дальше открываешь любую отдельную запись и проверяешь связку «согласие + лицензия + оплата»; и в итоге можешь прогнать через Trace весь список записей, из которых собран интересующий датасет, и получить сводный отчёт о комплаенсе буквально за секунды, а не за недели ручных проверок юристов. На сайте Trace команда даже выкладывает демонстрационный аудит на 12 480 записей, где каждая цифра в отчёте кликабельна и ведёт к конкретной квитанции, которая её подтверждает.
В экосистему помимо Trace входят ещё два слоя: приложения-поставщики данных (Kled, Numo и другие), через которые люди добровольно делятся своими данными за вознаграждение, и Poseidon — модуль, который превращает сырые размеченные записи в готовые к обучению датасеты. Формула, которую продвигает команда, простая: контрибьюторы приносят данные → Trace фиксирует происхождение и согласие → Poseidon упаковывает это в датасет → лаборатория покупает результат, уже зная, что он юридически чист.
Что настораживает
Здесь стоит включить трезвый взгляд. Запуск сопровождался пресс-релизом уровня Chainwire и громкими цифрами (1,5 млрд записей), но это заявленные метрики самой команды, а не независимо проверенные показатели — насколько глубоко лаборатории реально пользуются реестром и покупают данные через Trace, пока судить рано. Технически идея выглядит логично: провенанс и согласие — это ровно то, для чего блокчейн подходит хорошо, поскольку неизменяемость записи и публичная верифицируемость здесь работают на пользу, а не просто добавляют модное слово в питч. Но у подхода есть узкое место — доверие переносится с самих данных на добросовестность контрибьютора и оператора приложения на входе: если кто-то подписал «согласие» за чужой контент или подделал источник ещё до попадания хэша в блокчейн, никакой Merkle-корень это не исправит. Реестр доказывает целостность записи после регистрации, а не правду на входе.
Какие перспективы
Тренд, в который упаковывается DATA Foundation, шире одного протокола: индустрия ИИ действительно движется от «стащить всё, что плохо лежит» к «купить данные с понятной цепочкой прав» — просто потому что риск исков и репутационных потерь для крупных лабораторий стал слишком дорогим. Если модель докажет жизнеспособность на практике, а не только в пресс-релизах, DATA Network может стать одним из инфраструктурных стандартов для рынка лицензированных данных — по аналогии с тем, как ончейн-реестры уже прижились в верификации происхождения NFT или цепочек поставок. Но конкуренция здесь будет не столько с другими блокчейн-протоколами, сколько с привычными офчейн-контрактами и внутренними комплаенс-отделами больших лабораторий, которым ещё предстоит решить, готовы ли они доверять аудит своих датасетов публичному блокчейн-реестру.
Источники
Trace — https://trace.datafdn.org/
The DATA Foundation — https://www.datafdn.org/
Chainwire, пресс-релиз о запуске DATA Foundation (25 июня 2026)