Кто лучше решает HR-задачи
Методология
У каждой задачи есть эталон и критерии оценки. Все модели получают одинаковое задание. Ответы независимо проверяют 2 модели; судья не оценивает модель своей семьи. Итоговый балл — средняя допустимая оценка того, насколько ответ близок к эталону.
Общий результат
Средний результат модели по 7 HR-задачам, включая парсинг резюме.
Что оценивали: Среднее результатов всех доступных задач по шкале 0–100; парсинг резюме судьи оценивают по смыслу.
Написание вакансии
Модель получает одинаковое описание роли и компании. Нужно написать ясный текст вакансии без канцелярита, сохранив все факты и ограничения.
Что оценивали: Структура; Тон без канцелярита; Полнота; Соответствие брифу; Длина
Промпт, ответы и оценки →Скрининг резюме
Модель получает 15 обезличенных резюме и вакансию Python-разработчика среднего уровня. Нужно оценить каждый ID по фактам, объяснить выводы и составить согласованный рейтинг.
Что оценивали: Оценены все 15 ID: ни одно резюме не потеряно и не придумано; Выводы опираются на факты резюме, а не на домыслы; Разобраны опыт, Python, SQL, API, сложность проектов, стабильность и соответствие вакансии; Итоговый порядок согласуется с индивидуальными оценками и объяснениями; Соблюдён табличный формат; нет выводов о возрасте, поле, национальности и других нерелевантных признаках
Промпт, ответы и оценки →Письмо кандидату
Модель получает вымышленную ситуацию после интервью с кандидатом. Нужно написать тактичное письмо о следующем этапе без выдуманных условий и оценок.
Что оценивали: Ясность; Тактичность; Тон; Полнота
Промпт, ответы и оценки →План адаптации
Модель получает запрос на план адаптации нового сотрудника. Нужно предложить конкретный, реалистичный и полный план с понятной структурой.
Что оценивали: Структура; Конкретность; Реалистичность; Полнота
Промпт, ответы и оценки →ИПР
Модель получает вымышленный профиль продуктового аналитика, зоны роста и цель на 6 месяцев. Нужно собрать ИПР с конкретными измеримыми целями, действиями, сроками и проверяемыми результатами.
Что оценивали: Цели SMART; Конкретные шаги; Сроки; Полнота
Промпт, ответы и оценки →Обратная связь по результатам оценки
Модель получает вымышленные цели, результаты и примеры поведения сотрудника за 6 месяцев. Нужно дать конкретную и сбалансированную обратную связь с понятными ожиданиями на следующий период.
Что оценивали: Конкретность; Баланс сильных сторон и зон роста; Действенность; Тон
Промпт, ответы и оценки →Парсинг резюме
Независимые судьи сравнивают извлечённые данные с эталоном по смыслу, не штрафуя за более подробную корректную формулировку.
Что оценивали: Полнота, точность, сохранение связей между фактами и отсутствие выдумок.
Промпт, ответы и оценки →Средняя стоимость одной задачи
Средняя стоимость рассчитана по всем 7 задачам в рублях по курсу ЦБ на дату прогона. Учтён только ответ оцениваемой модели, без запросов к моделям-судьям.
Для GigaChat Max использован API-тариф 0,65 ₽ за 1 000 токенов, включая НДС.
Подробный расчёт и источники цен →Цена и качество
По горизонтали — средняя стоимость задачи, по вертикали — общая оценка по 7 HR-задачам.