Подготовка датасетов для LLM собирает записи, которым должна научиться языковая модель: инструкция, контекст, которым можно пользоваться, и ответ, который вы готовы защищать. Датасеты для LLM — не свалка вики в промпт. У каждой строки есть источник, пометка о праве использования и причина, почему она относится к задаче.
Проверяю загрязнение: текст публичных бенчмарков и почти-копии проверочной выборки не лежат тихо в train. Знаменитый набор для оценки я не вставляю, чтобы «поднять балл». Если модель должна отвечать по вашим документам в момент запроса, это RAG, а не более толстый корпус предобучения. Пары для последующего обновления — данные для fine-tuning.
Приёмка — контракт полей (инструкция, контекст, ответ), выборка, которую можно прочитать, и заметка, что исключено как загрязнение или как текст без права. Узкий набор инструкций часто занимает 3–5 недель. Карта старта есть и в статье инженерия датасетов.
