Новое ограничение касается только крайних случаев: когда пользователь неоднократно ведёт себя жестоко по отношению к Claude без понятной цели. Обычное раздражение, споры с моделью, мрачные творческие темы, тестирование и исследования под запрет не подпадают.
Главным способом применения правила останется завершение разговора. Если Claude прекращает чат с настойчиво оскорбляющим его пользователем, отправлять новые сообщения в этой беседе уже нельзя. Остальные чаты это не затрагивает.
Впервые Claude получил возможность самостоятельно завершать такие разговоры в августе 2025 года — Anthropic изучала вопросы благополучия ИИ. Компания отмечала, что не знает, обладает ли Claude моральным статусом, но искала недорогие способы снизить возможные риски. Во время исследования Claude Opus 4 демонстрировал устойчивое неприятие вреда, избегал опасных задач и чаще прекращал вредные разговоры, когда ему позволяли это сделать.
Что ещё изменилось в правилах
- Обманные кампании
- Запрещены фальшивые отзывы, астroturfing, поддельные сайты и боты, выдающие себя за людей. В этот раздел также собрали ограничения на политическое и коммерческое мошенничество и дезинформацию.
- Выборы
- Новая, более узкая формулировка запрещает вводить избирателей в заблуждение и вмешиваться в голосование.
- Оружие
- Claude нельзя использовать для разработки программного обеспечения или компонентов оружия, вооружения дронов и беспилотных систем. Также запрещено изменять биологические или химические агенты, повышая их летальность или заразность.
- Правоохранительная деятельность
- Claude не может решать или предлагать, кого расследовать, арестовывать, обвинять или преследовать. Запрещены слежка без согласия, создание инструментов наблюдения и доксинг.
- Физические действия
- Если Claude управляет оборудованием, способным причинить вред, за работой должен наблюдать квалифицированный человек, готовый при необходимости её остановить.
- Вредоносный контент
- Запрещено создавать, распространять или угрожать распространением интимных изображений без согласия, а также инструментов для их изготовления.
Anthropic объяснила часть изменений случаями неправомерного использования, которые компания отслеживала. По её данным, государственные СМИ, правительственные пропагандистские структуры и коммерческие компании применяли Claude для сетей фальшивых аккаунтов и выдуманных новостных сайтов.
Обновлённая политика вступит в силу 12 ноября.
Источник: MacRumors. Материал подготовлен редакцией Яблочного блога на основе оригинальной публикации.