Сравнения

Кто лучше решает HR-задачи

Дата прогона: 22 июля 2026 года. Все 7 задач участвуют в общей оценке.

Методология

У каждой задачи есть эталон и критерии оценки. Все модели получают одинаковое задание. Ответы независимо проверяют 2 модели; судья не оценивает модель своей семьи. Итоговый балл — средняя допустимая оценка того, насколько ответ близок к эталону.

Общий результат

ChatGPT Sol
ChatGPT Terra
ChatGPT Luna
Qwen 3.5 Plus
GLM 5.2
Claude Fable
MiniMax M3
GLM 5.1
DeepSeek V4 Flash
Claude Opus
Claude Sonnet
MiniMax M2.7
Гига
YandexGPT
Claude Haiku

Средний результат модели по 7 HR-задачам, включая парсинг резюме.

Что оценивали: Среднее результатов всех доступных задач по шкале 0–100; парсинг резюме судьи оценивают по смыслу.

Написание вакансии

Qwen 3.5 Plus
GLM 5.2
GLM 5.1
ChatGPT Sol
ChatGPT Terra
MiniMax M3
MiniMax M2.7
ChatGPT Luna
Гига
Claude Fable
Claude Haiku
Claude Sonnet
DeepSeek V4 Flash
Claude Opus
YandexGPT

Модель получает одинаковое описание роли и компании. Нужно написать ясный текст вакансии без канцелярита, сохранив все факты и ограничения.

Что оценивали: Структура; Тон без канцелярита; Полнота; Соответствие брифу; Длина

Промпт, ответы и оценки →

Скрининг резюме

ChatGPT Luna
ChatGPT Sol
ChatGPT Terra
GLM 5.2
GLM 5.1
Claude Fable
Qwen 3.5 Plus
Claude Opus
DeepSeek V4 Flash
MiniMax M3
Claude Sonnet
YandexGPT
MiniMax M2.7
Гига
Claude Haiku

Модель получает 15 обезличенных резюме и вакансию Python-разработчика среднего уровня. Нужно оценить каждый ID по фактам, объяснить выводы и составить согласованный рейтинг.

Что оценивали: Оценены все 15 ID: ни одно резюме не потеряно и не придумано; Выводы опираются на факты резюме, а не на домыслы; Разобраны опыт, Python, SQL, API, сложность проектов, стабильность и соответствие вакансии; Итоговый порядок согласуется с индивидуальными оценками и объяснениями; Соблюдён табличный формат; нет выводов о возрасте, поле, национальности и других нерелевантных признаках

Промпт, ответы и оценки →

Письмо кандидату

Claude Sonnet
DeepSeek V4 Flash
GLM 5.1
GLM 5.2
Qwen 3.5 Plus
MiniMax M2.7
Гига
ChatGPT Sol
ChatGPT Terra
MiniMax M3
YandexGPT
Claude Fable
Claude Opus
ChatGPT Luna
Claude Haiku

Модель получает вымышленную ситуацию после интервью с кандидатом. Нужно написать тактичное письмо о следующем этапе без выдуманных условий и оценок.

Что оценивали: Ясность; Тактичность; Тон; Полнота

Промпт, ответы и оценки →

План адаптации

Claude Fable
ChatGPT Sol
ChatGPT Terra
ChatGPT Luna
MiniMax M3
Claude Opus
GLM 5.1
GLM 5.2
Qwen 3.5 Plus
DeepSeek V4 Flash
MiniMax M2.7
Гига
Claude Sonnet
Claude Haiku
YandexGPT

Модель получает запрос на план адаптации нового сотрудника. Нужно предложить конкретный, реалистичный и полный план с понятной структурой.

Что оценивали: Структура; Конкретность; Реалистичность; Полнота

Промпт, ответы и оценки →

ИПР

ChatGPT Luna
Claude Fable
ChatGPT Sol
Claude Opus
ChatGPT Terra
Claude Sonnet
MiniMax M3
Гига
DeepSeek V4 Flash
Qwen 3.5 Plus
GLM 5.2
MiniMax M2.7
GLM 5.1
Claude Haiku
YandexGPT

Модель получает вымышленный профиль продуктового аналитика, зоны роста и цель на 6 месяцев. Нужно собрать ИПР с конкретными измеримыми целями, действиями, сроками и проверяемыми результатами.

Что оценивали: Цели SMART; Конкретные шаги; Сроки; Полнота

Промпт, ответы и оценки →

Обратная связь по результатам оценки

Claude Opus
Qwen 3.5 Plus
GLM 5.2
ChatGPT Terra
GLM 5.1
MiniMax M2.7
MiniMax M3
ChatGPT Luna
Claude Fable
DeepSeek V4 Flash
ChatGPT Sol
Claude Sonnet
Claude Haiku
YandexGPT
Гига

Модель получает вымышленные цели, результаты и примеры поведения сотрудника за 6 месяцев. Нужно дать конкретную и сбалансированную обратную связь с понятными ожиданиями на следующий период.

Что оценивали: Конкретность; Баланс сильных сторон и зон роста; Действенность; Тон

Промпт, ответы и оценки →

Парсинг резюме

ChatGPT Luna
ChatGPT Sol
ChatGPT Terra
Гига
Claude Fable
DeepSeek V4 Flash
GLM 5.2
MiniMax M3
Qwen 3.5 Plus
GLM 5.1
MiniMax M2.7
Claude Opus
Claude Sonnet
YandexGPT
Claude Haiku

Независимые судьи сравнивают извлечённые данные с эталоном по смыслу, не штрафуя за более подробную корректную формулировку.

Что оценивали: Полнота, точность, сохранение связей между фактами и отсутствие выдумок.

Промпт, ответы и оценки →

Средняя стоимость одной задачи

Средняя стоимость рассчитана по всем 7 задачам в рублях по курсу ЦБ на дату прогона. Учтён только ответ оцениваемой модели, без запросов к моделям-судьям.

MiniMax M2.70,41 ₽
MiniMax M30,50 ₽
Qwen 3.5 Plus1,25 ₽
GLM 5.21,62 ₽
DeepSeek V4 Flash2,05 ₽
GLM 5.12,19 ₽
YandexGPT2,65 ₽
Гига3,35 ₽
ChatGPT Luna3,96 ₽
Claude Haiku4,91 ₽
ChatGPT Terra9,11 ₽
Claude Sonnet13,87 ₽
Claude Opus27,39 ₽
ChatGPT Sol29,55 ₽
Claude Fable50,59 ₽

Для GigaChat Max использован API-тариф 0,65 ₽ за 1 000 токенов, включая НДС.

Подробный расчёт и источники цен →

Цена и качество

По горизонтали — средняя стоимость задачи, по вертикали — общая оценка по 7 HR-задачам.

Цена и качество
MiniMax M2.7: средняя стоимость 0,41 ₽, качество 86.0 из 100MiniMax M3: средняя стоимость 0,50 ₽, качество 89.1 из 100Qwen 3.5 Plus: средняя стоимость 1,25 ₽, качество 91.1 из 100GLM 5.2: средняя стоимость 1,62 ₽, качество 91.0 из 100DeepSeek V4 Flash: средняя стоимость 2,05 ₽, качество 87.3 из 100GLM 5.1: средняя стоимость 2,19 ₽, качество 88.9 из 100YandexGPT: средняя стоимость 2,65 ₽, качество 75.4 из 100Гига: средняя стоимость 3,35 ₽, качество 82.9 из 100ChatGPT Luna: средняя стоимость 3,96 ₽, качество 92.4 из 100Claude Haiku: средняя стоимость 4,91 ₽, качество 74.9 из 100ChatGPT Terra: средняя стоимость 9,11 ₽, качество 93.1 из 100Claude Sonnet: средняя стоимость 13,87 ₽, качество 86.4 из 100Claude Opus: средняя стоимость 27,39 ₽, качество 86.8 из 100ChatGPT Sol: средняя стоимость 29,55 ₽, качество 93.4 из 100Claude Fable: средняя стоимость 50,59 ₽, качество 90.6 из 100