toolcall.
Модели4 авг. 2026 г., 14:25 UTC

Mistral открыла Shieldstral для гибкой модерации AI-контента

Модель на 3B параметров проверяет текст и изображения по правилам, заданным обычным языком, без дообучения.

Mistral AI выпустила Shieldstral, safety-классификатор на 3B параметров для модерации текста, изображений и смешанного text-image контента. Модель доступна с открытыми весами под лицензией Apache 2.0.

Главное отличие в том, как задается политика. Вместо одной жестко зашитой таксономии вредного контента Shieldstral принимает правило или вопрос обычным языком во время inference и возвращает калиброванную оценку да/нет. Поэтому продуктовая команда может проверять один и тот же контент по собственным правилам без дообучения классификатора под каждый сценарий.

Mistral говорит, что Shieldstral через один question-answering интерфейс закрывает классификацию промптов, модерацию ответов, определение отказов и toxicity checks. Компания утверждает, что модель на 3B параметров сопоставима или лучше открытых guardrail-моделей до семи раз крупнее на ряде text-safety и multimodal benchmark, при этом работает на одной Nvidia GPU с 16GB памяти.

Для разработчиков и платформ это означает более дешевую и настраиваемую модерацию AI-продуктов, где правила отличаются по индустриям, возрастным группам или уровню риска. Для open-model экосистемы это еще один сигнал: safety-инструменты становятся частью релиза модели, а не только внешним policy-слоем вокруг закрытых систем.

Источники

Упоминаются

ai-safetymistralopen-weightssafety