Запрос
Вы описываете задачу, цели и ограничения — сроки, бюджет, инфраструктура.
Новости для разработчиков без шума — My Dev News в Telegram.

Превращаем сырые данные компании в датасет, пригодный для обучения AI-моделей.
Беру сырые выгрузки компании и собираю из них датасет, на котором можно обучать модель, а не папку файлов «на потом». Таблицы, переписки, заявки, сканы, фото товаров и складские дампы редко приходят одной устойчивой схемой. Подготовка данных для AI — работа до fine-tuning и до внедрения: собрать то, что уже есть, очистить, убрать дубли и мусор, разметить то, чему модель должна научиться, и отдать файлы, которые читает обучение.
Продаю это как AI Dataset Engineering: сырые данные компании становятся датасетом, пригодным для обучения AI-моделей. На выходе — письменная схема, воспроизводимый скрипт, разбиение train / validation / test и отчёт о качестве. Не продаю загадочную папку CSV. JSONL, Parquet и WebDataset — форматы сдачи. Продукт — данные, у которых до первого прогона известны смысл полей, лицензия источника и риск утечки в проверку.
Эта страница — про подготовку данных, не про запуск модели в проде. Если корпус уже чистый и нужен ассистент, RAG или распознавание документов, это внедрение AI. Разметка десяти тысяч изображений и проводка API — разные сметы, я их не смешиваю.
В границы входят источники, очистка, дедупликация, фильтр мусора, инструкция разметки, synthetic data там, где живых примеров мало, и честное разбиение. Покупка чужих баз, юридическое заключение по персональным данным и само обучение модели не входят, пока это прямо не сказано в брифе. Узкий пилот на одном источнике и одной задаче часто занимает 3–6 недель. Несколько источников и разметка изображений считаются по объёму, не по слогану.
Финальный акт приёмки фиксируется в брифе или договоре; список выше — ориентир для согласования scope.
Вы описываете задачу, цели и ограничения — сроки, бюджет, инфраструктура.
Задаю вопросы, при необходимости смотрю текущий код или ТЗ, фиксируем объём.
Предлагаю этапы, приоритеты и ориентир по срокам; согласовываем формат отчётности.
Итерации с промежуточными результатами: коммиты, демо, обратная связь.
Деплой, документация по необходимости; договариваемся о сопровождении или точечных доработках.
Нажмите на вопрос, чтобы раскрыть ответ.
Датасет, пригодный для обучения, плюс схема, скрипт, который его пересобирает, разбиение train / validation / test и отчёт о качестве. Формат согласуем заранее: JSONL, Parquet или WebDataset.
На этой странице нет. Подготовка заканчивается данными, которые читает обучение. Вывод модели в продукт — это внедрение AI.
Юридическое заключение я не выдумываю. Помечаем поля, похожие на персональные данные, убираем или маскируем их, если так сказано в брифе, и не тащим сырые выгрузки в переписку. Формальная проверка — отдельная строка сметы.
Один свой источник и одна задача часто занимают 3–6 недель после появления доступа. Объём разметки изображений и лишние источники меняют оценку.
Да. В приёмку входят скрипт и заметки, по которым датасет собирается из тех же выгрузок без моего участия.