Содержание 2
Vals, стартап 2024 года, поднял $40 млн в серии A от Andreessen Horowitz. Не публикует тесты, измеряет реальные задачи: юрфирмы, финансы, кодинг, даже law of armed conflict по Женевской конвенции. Co-founder Rayan Krishnan: «бенчмарки должны проверять, что модель делает продукт такого качества, как человек». Vals измеряет не общий IQ, а реальный вклад в продукт. Компании платят за тестирование, чтобы лучше понимать, как дорабатывать модели. Krishnan сравнивает с SAT: студент платит, чтобы знать свой уровень. Vals недавно показал, что оценки становятся ключевым фактором при покупке новых AI-моделей.
Что Vals не делает
Не публикует тесты — чтобы компания не тренировалась на них. Не измеряет только общий IQ. Фокус на индустриальных задачах: юр, фин, кодинг, mental health, cybersecurity, biosecurity. Это не «AI знает всё», а «AI может сделать продукт». В 2024-м seed от 8VC и Bloomberg Beta, в 2025-м — $40 млн от a16z. Co-founder Krishnan — бывший Palantir, Microsoft, Stanford AI lab.
Имеет смысл не путать Vals с обычным бенчмарком. Это не «AI знает факты», это «AI может сделать работу юриста, финансиста или кодера». Для Минска — не инструмент, а история: кто-то в Кремниевой долине платит за тестирование, чтобы лучше дорабатывать модели.
| Что Vals | Что не Vals |
|---|---|
| Реальные задачи юр, фин, кодинг | публичные тесты |
| Negative outcomes тоже | только общий IQ |
| $40 млн от a16z | публичные тесты |
| 25-летний Krishnan | «AI знает всё» |
Кто платит
Компании платят Vals за тестирование. Это как SAT: студент платит, чтобы знать уровень. Vals AI benchmarking становится ключом при покупке новых моделей: если ваша не проходит — её не купят в корпоративный стек. Krishnan отдельно мерит recursive self-improvement, mental health, cybersecurity, biosecurity и даже law of armed conflict — как модель применит Женевскую конвенцию. Офис на Folsom Street, бывшая пивоварня. Seed в 2024-м, серия A в августе 2026-го. Для Минска это не кнопка в чате: это история про то, кто в долине платит, чтобы узнать, что модель врёт в юрзадаче, а не на баре экзамене.
По теме: Anthropic против GPT-6, на фабах людей не хватает.
Текст TehnoRex. Дата: 2026-09-19.



