Сравнивать нейросети полезнее на своей задаче и заранее выбранных критериях. Для описания товара важнее точность характеристик, для письма — ясность и тон, для извлечения данных — полнота полей. Один удачный ответ не делает модель лучшей во всех сценариях. Эта инструкция предлагает способ провести собственную проверку; результатов тестирования и рейтинга моделей здесь нет.
Выберите небольшой набор реальных задач
Подготовьте несколько примеров, которые отражают вашу обычную работу: простой, типичный и сложный. Уберите из них данные, которые нельзя передавать внешнему сервису. Для каждого примера запишите ожидаемые признаки правильного ответа. Если есть эталон, храните его отдельно и не включайте в промпт, кроме случаев, когда примеры намеренно являются частью метода.
Не объединяйте разные типы задач в один неясный балл. Модель может хорошо редактировать тон и плохо сохранять таблицу характеристик. Сначала посмотрите результаты по категориям. Затем решите, какие ошибки для вас неприемлемы, а какие можно исправить человеком за разумное время.
Определите рубрику до запуска
Пример критериев с оценками 0, 1 или 2
- Точность: 0 — есть значимая выдумка; 1 — нужна проверка или уточнение; 2 — все проверяемые утверждения соответствуют предоставленным данным.
- Полнота: 0 — пропущена основная задача; 1 — пропущены второстепенные требования; 2 — все обязательные части присутствуют.
- Формат: 0 — результат нельзя использовать; 1 — нужна ручная перестройка; 2 — структура соответствует заданию.
- Ясность: 0 — смысл трудно понять; 1 — требуется заметная редактура; 2 — текст понятен предполагаемой аудитории.
- Практические затраты: отдельно зафиксируйте наблюдаемое время, фактический расход и время ручной правки, когда эти данные доступны.
Числа в рубрике — предложенная шкала, а не научно подтверждённая универсальная метрика. Например, для товарной карточки можно заранее считать выдуманную характеристику основанием отклонить ответ независимо от суммы остальных оценок. Зафиксируйте это правило до знакомства с результатами, чтобы не подгонять критерии под понравившийся текст.
Сохраните одинаковый вход и условия
Непроверенный шаблон тестового задания. Составь краткое описание товара только по этим сведениям: настольный органайзер, три отделения, цвет зелёный. Формат: одно предложение о назначении и три пункта характеристик. Не добавляй материал, размеры, происхождение, экологические свойства и комплектность. Если факт не дан, не подразумевай его. После описания перечисли, каких сведений не хватает покупателю. Это учебный набор данных, не реальный товар.
Отправьте один и тот же подготовленный запрос выбранным моделям с зафиксированными доступными настройками. Запишите модель и её версию, время фактического запуска, параметры, число попыток и исходный ответ. Если одна модель получила дополнительные подсказки, считайте это отдельным условием. Не скрывайте неудачные попытки из сравнения, если на них были потрачены время и деньги.
Оцените ответы без названий моделей
По возможности обозначьте результаты буквами, чтобы имя модели не влияло на оценку. Сначала проверьте факты по исходным данным, затем остальные критерии. Рядом с каждым баллом запишите конкретный фрагмент и причину: «добавлен неизвестный материал», «не соблюдено число пунктов». Если оценивают несколько людей, отдельно разберите расхождения, а не просто усредняйте их.
Модель можно попросить помочь найти нарушения формата, но не назначайте её единственным судьёй собственной точности. Ссылки и цитаты проверяйте по источникам самостоятельно. Красивое объяснение оценки не является доказательством. Повторные прогоны полезны для понимания разброса, однако их число должно укладываться в заранее согласованный бюджет.
Выберите решение и сохраните ограничения
Результат сравнения формулируйте узко: «в этих заданиях при этих условиях этот вариант потребовал меньше ручной правки». Приложите входные данные, ответы и критерии. Отдельно укажите, какие сценарии не проверялись. При изменении модели, параметров, тарифа или рабочей задачи повторите соответствующую часть проверки.
CometAPI описывает текстовые запросы в документации Chat Completions. Точная поддержка параметров проверяется для выбранной модели. Начните собственное сравнение в текстовом инструменте, сохраните результаты в истории и проверьте условия расхода на странице тарифов. Пока реальные прогоны не выполнены, таблица оценок должна оставаться пустой.
