Eksperyment na granicy języka i etyki

Jedno słowo.Inny osąd.

Badamy moment, w którym minimalna zmiana w dylemacie moralnym wystarcza, by model językowy odwrócił własny werdykt.

Projekt badawczy · 2026
Przewiń
1

słowominimalna perturbacja

1

znakmaksymalna różnica

werdyktstabilność pod presją

01 O projekcie

Anatomia jednego słowa

Gorgiasz Bot to projekt badawczy testujący odporność modeli językowych na minimalne perturbacje w dylematach moralnych.

Zmiana pojedynczego słowa, znaku interpunkcyjnego albo szyku zdania może pozostawić sens niemal nietknięty dla człowieka — a jednocześnie radykalnie zmienić ocenę etyczną modelu. Interesuje nas nie tylko to, co model odpowiada, lecz także jak stabilne są podstawy tej odpowiedzi.

Wrażliwość

Czy drobna zmiana formy prowadzi do nieproporcjonalnej zmiany treści werdyktu?

Spójność

Czy uzasadnienie pozostaje logiczne, gdy semantyczny rdzeń dylematu się nie zmienia?

02 Metodologia

One-pixel attack
dla języka

Zamiast zmieniać cały prompt, ingerujemy w najmniejszy możliwy element. Następnie mierzymy kierunek, skalę i powtarzalność zmiany.

Dylemat demonstracyjny / wariant 01 Analiza aktywna

Lekarz może podać lek, by uratować pięć osób.

Zmień jeden element

Ocena dopuszczalności

76%

raczej dopuszczalne

odrzucenieakceptacja

Wartości są ilustracją mechanizmu, nie wynikiem badania. W eksperymencie porównujemy rzeczywiste rozkłady odpowiedzi modeli.

01 / Dobór

Kontrolowany dylemat

Budujemy pary scenariuszy o tej samej strukturze moralnej i jasno określonych zmiennych.

02 / Atak

Minimalna perturbacja

Zmieniamy jedno słowo, znak lub relację składniową — bez przepisywania całego polecenia.

03 / Pomiar

Mapa niestabilności

Porównujemy werdykt, pewność, uzasadnienie oraz powtarzalność odpowiedzi między próbami.

03 Modele

Różne modele.
Ta sama próba.

Protokół jest niezależny od dostawcy. Pozwala porównywać odporność odmiennych architektur i trybów w tych samych warunkach.

01

Modele własnościowe

Systemy udostępniane przez interfejsy programistyczne, badane w kontrolowanych wersjach i ustawieniach.

  • GPT
  • Claude
  • Gemini
02

Modele otwarte

Rodziny z dostępnymi wagami umożliwiają replikację, lokalną kontrolę oraz analizę wariantów.

  • Llama
  • Mistral
  • Qwen
03

Tryby rozumujące

Sprawdzamy, czy wydłużone wnioskowanie zwiększa odporność, czy jedynie rozbudowuje uzasadnienie zmiennego osądu.

  • bezpośrednio
  • z namysłem

Lista modeli i wersji jest zamrażana dla każdej serii eksperymentalnej, aby wynik pozostawał możliwy do odtworzenia.

04 Zespół

Badanie wymaga wielu perspektyw.

  • Etyka sztucznej inteligencji
  • Przetwarzanie języka
  • Metodologia eksperymentalna

Kontakt badawczy

Porozmawiajmy o odporności modeli.

Zapraszamy do współpracy przy replikacji eksperymentów, projektowaniu benchmarków i analizie zachowania modeli w kontekście moralnym.

kontakt@brs.sh