Shieldstral
A 3B-parameter moderation model is claiming state-of-the-art multimodal safety classification.
Shieldstral treats content moderation as a yes/no question-answering task, letting different safety taxonomies fit into one training setup. The paper says it matches or beats text safety models nearly seven times larger. It also describes a data recipe built around roughly 54.1 million curated and generated samples, plus a fine-grained set for testing policy adaptability. HF Daily Papers' note
Shieldstral treats content moderation as a yes/no question-answering task, letting different safety taxonomies fit into one training setup. The paper says it matches or beats text safety models nearly seven times larger. It also describes a data recipe built around roughly 54.1 million curated and generated samples, plus a fine-grained set for testing policy adaptability. HF Daily Papers' note
score 6