Подготовка текстовых датасетов превращает документы, заявки, переписки и страницы базы знаний в записи, на которых модель может учиться. На каждой строке остаются язык, источник и устойчивый идентификатор. Текстовые датасеты — это ещё не файлы для fine-tuning чата: сначала текст должен быть целым, в нужной кодировке и нарезанным там, где его нарезал бы человек.
Снимаю только тот шаблон, который бриф назвал мусором. Не переводу корпус «чтобы стало больше», если перевод не является задачей. Нарезка следует единице метки: заявка, абзац, реплика. Смешанные языки помечаю, а не сливаю в один. Персональные данные маскирую, когда бриф говорит, что модель их видеть не должна.
Приёмка — выборка записей с идентификаторами источника, заметка, как резали текст, и счётчик строк, снятых как пустые или нечитаемые. Формат сдачи — следующий шаг: JSONL, Parquet и WebDataset. Один корпус часто занимает 2–4 недели после появления выгрузок.
