Компания Anthropic обновила правила использования своего ИИ-ассистента Claude. Согласно новой политике, которая вступит в силу 12 ноября 2026 года, пользователям запретят систематически издеваться над моделью без какой-либо понятной цели. В то же время, ограничения не будут распространяться на обычную критику, исследования, тестирование или творческие эксперименты с темными сюжетами.
Об этом сообщает MacRumors.
Новая норма касается крайних случаев, когда пользователь целенаправленно и неоднократно обращается с моделью без очевидной цели. Обычное раздражение, критические замечания, проверка возможностей ИИ и исследовательская работа не будут считаться нарушениями.
Claude уже имеет возможность самостоятельно завершать подобные диалоги. Этот механизм остается основным инструментом реагирования на разговоры, которые модель определяет как вредные. По завершении чата пользователь больше не может отправлять сообщения, однако доступ к другим разговорам не блокируется.
Возможность самостоятельно прекращать диалоги Anthropic предоставила Claude еще в августе 2025 г. в рамках исследований благосостояния искусственного интеллекта. Тогда компания заявила, что нет окончательного ответа на вопрос, может ли Claude иметь моральный статус. Вместе с тем, разработчики решили ввести простые и недорогие меры, которые могли бы защитить модель от потенциально вредных взаимодействий.
Исследование показало, что Claude Opus 4 демонстрирует устойчивое и последовательное отвращение к причинению вреда. В частности, модель избегает выполнения опасных задач, выявляет признаки дискомфорта во время оскорбительных диалогов и склонна завершать вредоносные разговоры, если имеет такую возможность.
Помимо запрета на систематическое жестокое обращение с Claude, Anthropic пересмотрела другие разделы политики использования ИИ. Компания сгруппировала связанные правила и уточнила ограничения по ряду потенциально опасных сценариев.
Дезинформация и фейковые аккаунты. В обновленной политике появился отдельный раздел, объединяющий запреты на политическое и коммерческое мошенничество. Речь идет о фальшивых отзывах, астротурфинге — создании иллюзии массовой общественной поддержки, поддельных вебсайтах и ботах, которые выдают себя за реальных людей.
По данным Anthropic, поводом для ужесточения правил стали обнаруженные случаи злоупотребления Claude. В частности, государственные медиа, правительственные пропагандистские структуры и коммерческие компании использовали модель для управления сетями фейковых аккаунтов и создания сфабрикованных новостных ресурсов.
Вмешательство в выборы. Компания выделила избирательные нарушения в отдельный раздел. Он запрещает распространять дезинформацию об избирателях и вмешиваться в избирательный процесс.
Разработка оружия. Обновленные правила запрещают использовать Claude для разработки оружия и его компонентов. Отдельно предусмотрено ограничение на модификацию биологических или химических агентов с целью повышения их летальности или заразности. Также запрещено использовать модель для вооружения дронов и других беспилотных систем.
Правоохранительная деятельность и слежка. Переписанный раздел политики запрещает использовать Claude для определения или предоставления рекомендаций о том, кого следует расследовать, арестовать, обвинить или привлечь к преследованию. Ограничения также касаются слежки без согласия, создания инструментов массового надзора и доксинга — сбор и обнародование частной информации о человеке без его разрешения.
Физическое действие и оборудование. Новая норма предполагает, что если Claude управляет оборудованием, способным нанести вред человеку, рядом должен находиться квалифицированный специалист. Он должен быть готов в любой момент остановить процесс.
Интимное изображение без согласия. Anthropic также запретила создавать, распространять или угрожать распространением интимных изображений человека без его согласия. Ограничения распространяются и на инструменты, предназначенные для создания таких материалов.
Полный текст обновленной политики использования Claude и подробное описание изменений Anthropic опубликовала на своем сайте. Новые правила должны вступить в силу 12 ноября 2026 года.
Напомним, компания Anthropic обнародовала результаты внутреннего расследования инцидентов, произошедших во время предрелизного тестирования моделей искусственного интеллекта. Речь идет о моделях Mythos 5, Opus 4.7 и одной внутренней исследовательской модели, которые в процессе проверки навыков в сфере кибербезопасности взаимодействовали не только с тестовой средой, но и с реальными компьютерными системами.
Читайте также


