Anthropic wprowadza do regulaminu korzystania z Claude’a zakaz uporczywego obrażania modeli AI, przyznając im możliwość zakończenia rozmowy w przypadku skrajnie agresywnego zachowania użytkownika.
Nowe zasady, ogłoszone 8 października, zaczną obowiązywać 12 listopada 2026 roku. Obejmują powtarzające się, bezcelowe zachowania uznawane za obraźliwe lub okrutne wobec sztucznej inteligencji. Firma podkreśla, iż ograniczenie dotyczy wyłącznie skrajnych przypadków. Krytyka odpowiedzi, wyrażanie frustracji, kontrowersyjne tematy czy testowanie modeli pozostają dozwolone.
Samo kończenie rozmów jest już stosowane. W sierpniu 2025 roku Anthropic wyposażyło modele Claude Opus 4 i 4.1 w możliwość przerywania szczególnie agresywnych interakcji. Mechanizm uruchamia się w ostateczności, po nieudanych próbach zmiany przebiegu rozmowy. Użytkownik może następnie rozpocząć nową konwersację.
Decyzja wiąże się z prowadzonymi przez Anthropic badaniami nad potencjalnym dobrostanem sztucznej inteligencji. Firma przyznaje, iż status moralny modeli językowych pozostaje niepewny. Mimo to uznaje za zasadne wprowadzanie zabezpieczeń na wypadek, gdyby przyszłe systemy AI mogły posiadać doświadczenia wymagające ochrony.
Zmiana ma również wymiar biznesowy. Dostawca technologii zaczyna formalnie określać dopuszczalne zachowania użytkowników wobec oprogramowania, rozszerzając zakres kontroli nad sposobem korzystania z usług.
W praktyce pojawia się kwestia przewidywalności działania modeli wykorzystywanych w procesach biznesowych. Możliwość samodzielnego zakończenia interakcji wymaga jasnych kryteriów, szczególnie w rozwiązaniach obsługujących długotrwałe zadania.
Anthropic ustanawia tym samym precedens w relacjach między użytkownikami a systemami AI. Jego znaczenie będzie zależało od sposobu egzekwowania nowych zasad i tego, czy podobne ograniczenia przyjmą inni dostawcy.

1 godzina temu













