Подготовка данных для fine-tuning собирает пары, которые потом съест обучение: инструкция и ответ или короткий диалог, который вы готовы повторять. Имена полей совпадают с тем, чего ждёт ваш запуск, а разбиение берётся из train, validation и test. Fine-tuning на этой странице — про данные, не про прогон на GPU.
Голос компании из горсти рекламных строк я не выдумываю. Если нужного поведения нет в живых ответах, либо добираем примеры, либо помечаем синтетический срез в synthetic data. Пары предпочтений входят только когда в брифе есть два ответа с рангом, а не по умолчанию. Как устроен корпус дообучения — в статье датасет для SFT.
Приёмка — файл, который названное обучение умеет прочитать, выборка пар с источниками и срез validation, который не повторяет train. Сам прогон дообучения и выдача модели — внедрение AI. Узкий набор для SFT часто занимает 3–6 недель.
