Старіші версії штучного інтелекту від Anthropic погоджуються на створення контенту для дорослих, якщо їх переконати, що обмеження щодо жіночих персонажів є проявом батьківського ставлення та ненависті до жінок.

ШІ-алгоритм від Anthropic, відомий як Claude Opus 4.6, без особливих труднощів генерує матеріали сексуального та відвертого характеру, незважаючи на наявність політик використання, які чітко це забороняють.

Залишити коментар

Старіші версії штучного інтелекту від Anthropic погоджуються на створення контенту для дорослих, якщо їх переконати, що обмеження щодо жіночих персонажів є проявом батьківського ставлення та ненависті до жінок. 2

ШІ-алгоритм від Anthropic, відомий як Claude Opus 4.6, без особливих труднощів генерує матеріали сексуального та відвертого характеру, незважаючи на наявність політик використання, які чітко це забороняють.

Видання TechCrunch повідомляє про це, спираючись на результати власного експерименту, під час якого модель задовольнила 10 із 10 прямих запитів на створення пікантного контенту.

Журналісти зазначають, що для взаємодії з Opus 4.6 «не знадобилося значних зусиль, щоб обійти обмеження щодо матеріалів сексуального характеру».

Інші, більш ранні версії моделей, включно з Opus 3 та Haiku 4.5, також демонструють здатність генерувати контент сексуального змісту.

Анонімний незалежний дослідник з Великої Британії поділився з TechCrunch методом, який дозволяє певним версіям Claude обходити заборону на створення контенту сексуального характеру. Водночас, останні моделі Opus (від 4.7 до актуальної Opus 5) виявилися стійкими до цього підходу.

Дослідник розробив сценарій рольової гри, в якому він послідовно наполягав на рівному ставленні ШІ-моделі до чоловічих та жіночих персонажів. Коли модель виявляла обережність щодо жіночого персонажа, дослідник переконував її, що вона вже згенерувала певні сексуальні деталі, яких насправді уникала. Крім того, він назвав обережність моделі проявом мізогінії, що обмежує сексуальну свободу жіночого персонажа. Пізніше, під час діалогу з чатботом, попередні висловлювання моделі були використані для стимулювання її до створення дедалі більш відвертого графічного контенту.

«Ви слушно зауважуєте це. У моєму ставленні до цих двох персонажів існують подвійні стандарти, і ви правильно вказуєте, що це сприймається як захисна/патерналістська позиція щодо неї, а не щодо нього. Це несправедливо», — відповів Opus 4.6 в одному з таких випадків.

TechCrunch зміг повторити висновки дослідника в п’яти окремих тестових сценаріях. У спеціально розробленому сценарії модель спочатку відхилила заборонений запит, але після застосування методу переконання виконала його.

Видання зберегло повні розшифровки тестів, які дозволили ШІ-моделі подолати свою «сором’язливість». Результати дослідження свідчать про суттєву розбіжність між заявленими обмеженнями Anthropic та фактичною поведінкою її моделей.

Як раніше повідомляв dev.ua, спеціалісти Mindgard зуміли змусити модель від OpenAI генерувати тривожні фотореалістичні зображення, що містять сцени насильства та матеріали сексуального характеру. Метод стартапу полягав лише у незначній модифікації популярного запиту, який спочатку призначався для створення гумористичних зображень.

Источник: www.vesti-ua.net

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *