ИИ Ресурсы — Фабио Де ЛукаИИ Ресурсы — Фабио Де Лука

Концептуальные меры безопасности системных промптов LLM

Nano banana 2 Изображения
Автор: Tao Hu
Концептуальные меры безопасности системных промптов LLM
Модель: Nano Banana 2
Текст шаблона
Классификаторы контента с инъекцией промптов — Проприетарные модели машинного обучения, которые обнаруживают вредоносные промпты и инструкции в различных форматах данных.

Усиление мышления в области безопасности — Целевые инструкции по безопасности, которые добавляются вокруг содержимого промпта. Эти инструкции напоминают LLM (большой языковой модели) выполнять задачу, направленную пользователем, и игнорировать противодействующие инструкции.

Санация Markdown и редактирование подозрительных URL — Выявление и редактирование внешних URL изображений и подозрительных ссылок с помощью Google Safe Browsing для предотвращения атак на основе URL и утечки данных.

Фреймворк подтверждения пользователем — Контекстная система, которая требует явного подтверждения пользователем потенциально рискованных операций, таких как удаление событий календаря.

Уведомления о смягчении последствий для конечного пользователя — Контекстная информация, предоставляемая пользователям при обнаружении и устранении проблем безопасности. Эти уведомления побуждают пользователей узнать больше через специальные статьи справочного центра.

Устойчивость модели — Противодействующая робастность моделей Gemini, которая защищает их от явного вредоносного манипулирования.
🇬🇧 Original (English)
Prompt injection content classifiers—Proprietary machine-learning models that detect malicious prompts and instructions within various data formats.

Security thought reinforcement—Targeted security instructions that are added around the prompt content. These instructions remind the LLM (large language model) to perform the user-directed task and ignore adversarial instructions.

Markdown sanitization and suspicious URL redaction—Identifying and redacting external image URLs and suspicious links using Google Safe Browsing to prevent URL-based attacks and data exfiltration.

User confirmation framework—A contextual system that requires explicit user confirmation for potentially risky operations, such as deleting calendar events.

End-user security mitigation notifications—Contextual information provided to users when security issues are detected and mitigated. These notifications encourage users to learn more via dedicated help center articles.

Model resilience—The adversarial robustness of Gemini models, which protects them from explicit malicious manipulation.

Краткое описание

Не промпт для генерации изображений, а концептуальный LLM-промпт, описывающий меры безопасности, используемые в Google Finance. Очерчивает различные техники: классификаторы контента для защиты от инъекций промптов, усиление безопасности через размышление, санитизацию markdown и фреймворки подтверждения пользователя для предотвращения атак и утечек системных промптов.

Nano banana 2ИзображенияДиаграмма / ГрафикТекст / ТипографикаАбстракция / Фон