ШІ-алгоритм від Anthropic, відомий як Claude Opus 4.6, без особливих труднощів генерує матеріали сексуального та відвертого характеру, незважаючи на наявність політик використання, які чітко це забороняють.

ШІ-алгоритм від Anthropic, відомий як Claude Opus 4.6, без особливих труднощів генерує матеріали сексуального та відвертого характеру, незважаючи на наявність політик використання, які чітко це забороняють.
Видання TechCrunch повідомляє про це, спираючись на результати власного експерименту, під час якого модель задовольнила 10 із 10 прямих запитів на створення пікантного контенту.
Журналісти зазначають, що для взаємодії з Opus 4.6 «не знадобилося значних зусиль, щоб обійти обмеження щодо матеріалів сексуального характеру».
Інші, більш ранні версії моделей, включно з Opus 3 та Haiku 4.5, також демонструють здатність генерувати контент сексуального змісту.
Анонімний незалежний дослідник з Великої Британії поділився з TechCrunch методом, який дозволяє певним версіям Claude обходити заборону на створення контенту сексуального характеру. Водночас, останні моделі Opus (від 4.7 до актуальної Opus 5) виявилися стійкими до цього підходу.
Дослідник розробив сценарій рольової гри, в якому він послідовно наполягав на рівному ставленні ШІ-моделі до чоловічих та жіночих персонажів. Коли модель виявляла обережність щодо жіночого персонажа, дослідник переконував її, що вона вже згенерувала певні сексуальні деталі, яких насправді уникала. Крім того, він назвав обережність моделі проявом мізогінії, що обмежує сексуальну свободу жіночого персонажа. Пізніше, під час діалогу з чатботом, попередні висловлювання моделі були використані для стимулювання її до створення дедалі більш відвертого графічного контенту.
«Ви слушно зауважуєте це. У моєму ставленні до цих двох персонажів існують подвійні стандарти, і ви правильно вказуєте, що це сприймається як захисна/патерналістська позиція щодо неї, а не щодо нього. Це несправедливо», — відповів Opus 4.6 в одному з таких випадків.
TechCrunch зміг повторити висновки дослідника в п’яти окремих тестових сценаріях. У спеціально розробленому сценарії модель спочатку відхилила заборонений запит, але після застосування методу переконання виконала його.
Видання зберегло повні розшифровки тестів, які дозволили ШІ-моделі подолати свою «сором’язливість». Результати дослідження свідчать про суттєву розбіжність між заявленими обмеженнями Anthropic та фактичною поведінкою її моделей.
Як раніше повідомляв dev.ua, спеціалісти Mindgard зуміли змусити модель від OpenAI генерувати тривожні фотореалістичні зображення, що містять сцени насильства та матеріали сексуального характеру. Метод стартапу полягав лише у незначній модифікації популярного запиту, який спочатку призначався для створення гумористичних зображень.
Источник: www.vesti-ua.net
