У ChatGPT та аналогах виявлено серйозні вразливості
Ці моделі, розроблені великими технологічними гігантами, є фундаментальними компонентами різних програм, від віртуальних помічників до систем модерації контенту.
Дослідники виявили, що вразливості у цих MLLM можуть бути використані у маніпульованих зображеннях, які нагадують оригінали. Шляхом внесення дрібних змін, практично невидимих для людського ока, дослідники успішно оминали вбудовані фільтри моделей, призначені для виявлення токсичного або невідповідного контенту.
Наприклад, дослідники в Пекіні виявили серйозну вразливість у моделях ШІ, таких як ChatGPT. В умовах атаки ці моделі могли помилково приймати гігантських панд за людей або не виявляти шкідливого контенту, що підкреслює критичну вразливість у комерційних системах штучного інтелекту.
Серед порушених моделей Bard, обладнаних механізмами розпізнавання облич та токсичності, могли генерувати невідповідні описи шкідливого контенту під час компрометації. Китайська дослідницька група навіть надала код, який демонструє, як ці атаки можуть вводити в оману моделі ШІ. Їхні експерименти продемонстрували успішність на рівні 22% проти Bard, 26% проти Bing Chat та значні 86% проти Ernie Bot.
Вчений-технолог з Китаю Чжаохуей висловив стурбованість цими тривожними результатами на Глобальному Саміті з безпеки ШІ у Великій Британії. Він наголосив на нагальній необхідності сильніших технічних заходів безпеки в управлінні штучним інтелектом і закликав глобальну спільноту розглянути виявлені вразливості в мовних моделях, що широко використовуються.
Для боротьби з цими вразливостями дослідники запропонували використання методів попередньої обробки як потенційного рішення, особливо для масштабних основних моделей. Ці методи спрямовані на забезпечення надійності MLLM проти атак та створюють шлях для майбутніх досліджень та розробок у галузі безпеки ШІ.
Джерело: gizmochina
AI
Користувачі ChatGPT помітили незвичну зміну в поведінці чат-бота: у звичайних розмовах він почав значно частіше використовувати ненормативну лексику. Причому іноді це відбувається навіть тоді, коли співрозмовник сам не вживає лайливих слів. Схоже, пояснення може бути пов'язане не з окремим «режимом лайки», а зі зміною підходу OpenAI до того, як модель підлаштовує стиль відповіді під контекст.
OpenAI представила ChatGPT for Teens — окремий режим роботи ChatGPT для користувачів віком від 13 до 17 років. Компанія робить акцент не лише на блокуванні небезпечного контенту, а й на тому, як саме штучний інтелект спілкується з підлітками, допомагає їм навчатися та вибудовує межі у тривалих розмовах.
Компанія Comu офіційно представила Action Pro — компактний ШІ-диктофон, який не просто записує та розшифровує розмови, а може перетворювати їх на презентації, електронні листи, документи, списки завдань і плани подальших дій. Головною особливістю новинки стала окрема кнопка для голосових команд штучному інтелекту.
