{"id":9396,"date":"2026-05-04T20:12:02","date_gmt":"2026-05-04T20:12:02","guid":{"rendered":"https:\/\/architeles.eu\/ethics\/?p=9396"},"modified":"2026-05-04T20:12:02","modified_gmt":"2026-05-04T20:12:02","slug":"analiza-ocen-rankingow-i-rekomendacji-generowanych-przez-duze-modele-jezykowe-ocena-wiarygodnosci-rzetelnosci-i-obiektywnosci-takich-wypowiedzi-oraz-pytanie-na-ile-mozemy-im-ufac-bezkrytycznie","status":"publish","type":"post","link":"https:\/\/architeles.eu\/ethics\/index.php\/2026\/05\/04\/analiza-ocen-rankingow-i-rekomendacji-generowanych-przez-duze-modele-jezykowe-ocena-wiarygodnosci-rzetelnosci-i-obiektywnosci-takich-wypowiedzi-oraz-pytanie-na-ile-mozemy-im-ufac-bezkrytycznie\/","title":{"rendered":"Analiza ocen, ranking\u00f3w i rekomendacji generowanych przez du\u017ce modele j\u0119zykowe. Ocena wiarygodno\u015bci, rzetelno\u015bci i obiektywno\u015bci takich wypowiedzi oraz pytanie, na ile mo\u017cemy im ufa\u0107 bezkrytycznie"},"content":{"rendered":"<p><strong>W dzisiejszym \u015bwiecie coraz cz\u0119\u015bciej uzale\u017cniamy nasze decyzje od sztucznej inteligencji, traktuj\u0105c modele takie jak ChatGPT, Claude czy Gemini jak darmowych ekspert\u00f3w i nieomylne wyrocznie. Bezkrytyczne zaufanie do ich ocen, ranking\u00f3w i rekomendacji to jednak pot\u0119\u017cny b\u0142\u0105d. Za pozorn\u0105 pewno\u015bci\u0105 siebie i profesjonalnym tonem wirtualnych asystent\u00f3w kryj\u0105 si\u0119 &#8222;stochastyczne papugi&#8221; \u2013 gigantyczne silniki statystyczne, kt\u00f3re nie posiadaj\u0105 wiedzy, lecz nieustannie ulegaj\u0105 systematycznym b\u0142\u0119dom, powielaj\u0105 uprzedzenia i zmy\u015blaj\u0105 fakty. Przeczytaj, dlaczego algorytmy wol\u0105 ci si\u0119 przypodoba\u0107 zamiast poda\u0107 obiektywn\u0105 prawd\u0119 i dlaczego jedyn\u0105 skuteczn\u0105 strategi\u0105 pracy z AI pozostaje dzi\u015b bezwzgl\u0119dna zasada Zero Trust.<\/strong><\/p>\n<p>W dzisiejszym zinformatyzowanym \u015bwiecie, podejmowanie decyzji staje si\u0119 coraz bardziej zale\u017cne od narz\u0119dzi opartych na sztucznej inteligencji. Niezale\u017cnie od tego, czy jeste\u015b zdesperowanym studentem informatyki pr\u00f3buj\u0105cym wybra\u0107 optymaln\u0105 baz\u0119 danych i bibliotek\u0119 do projektu na zaliczenie, czy te\u017c graczem stoj\u0105cym przed wyborem drogiego monitora OLED lub mechanicznej klawiatury, mechanizm dzia\u0142ania jest zazwyczaj identyczny. Siadasz do komputera, wpisujesz zapytanie do modeli takich jak ChatGPT, Claude czy Gemini i w u\u0142amku sekundy otrzymujesz pi\u0119knie sformatowan\u0105, autorytatywn\u0105 odpowied\u017a z ostateczn\u0105 rekomendacj\u0105. Z podobnych narz\u0119dzi korzystaj\u0105 mened\u017cerowie poszukuj\u0105cy oprogramowania do zarz\u0105dzania zespo\u0142em, kt\u00f3rym AI przedstawia gotowe por\u00f3wnania i bez wahania wskazuje &#8222;najlepsz\u0105&#8221; opcj\u0119.<\/p>\n<p>Brzmi to jak spe\u0142nienie marze\u0144 o natychmiastowym i darmowym ekspercie. Oszcz\u0119dzasz wiele godzin \u017cmudnego researchu na forach, GitHubie czy Stack Overflow. Prawda jest jednak znacznie bardziej mroczna. Du\u017ce modele j\u0119zykowe staj\u0105 si\u0119 naszymi s\u0119dziami, recenzentami i doradcami, chocia\u017c za ich pozorn\u0105 pewno\u015bci\u0105 siebie kryje si\u0119 niepokoj\u0105cy katalog systematycznych b\u0142\u0119d\u00f3w, halucynacji i uprzedze\u0144.<\/p>\n<h2>Architektura iluzji: Sk\u0105d sztuczna inteligencja &#8222;wie&#8221;, co poleci\u0107?<\/h2>\n<p>Aby zrozumie\u0107, dlaczego modele j\u0119zykowe tak fatalnie radz\u0105 sobie z obiektywn\u0105 ocen\u0105, trzeba najpierw pozna\u0107 ich fundamenty. Modele takie jak GPT-4o czy Gemini nie posiadaj\u0105 zdolno\u015bci do my\u015blenia ani nie posiadaj\u0105 wiedzy w ludzkim rozumieniu tych s\u0142\u00f3w. S\u0105 to w rzeczywisto\u015bci gigantyczne silniki statystyczne &#8211; next-token predictors, kt\u00f3rych wy\u0142\u0105cznym zadaniem jest wygenerowanie kolejnego, najbardziej prawdopodobnego s\u0142owa na podstawie gigantycznego zbioru danych treningowych oraz bie\u017c\u0105cego kontekstu.<\/p>\n<p>Ich nauka przebiega najcz\u0119\u015bciej w trzech etapach:<\/p>\n<p>Pretraining &#8211; model poch\u0142ania ogromne ilo\u015bci tekst\u00f3w z ksi\u0105\u017cek, internetu i artyku\u0142\u00f3w naukowych, ucz\u0105c si\u0119 na tym etapie, jak ludzko\u015b\u0107 pisze o danych us\u0142ugach czy technologiach. Je\u015bli internet w wi\u0119kszo\u015bci wypowiada\u0142 si\u0119 o czym\u015b pozytywnie, model na zawsze zakoduje to jako &#8222;dobre&#8221;.<br \/>\nFine-tuning (RLHF) &#8211; jest to uczenie ze wzmocnieniem na podstawie ludzkich opinii. Trenerzy pokazywali modelowi pary wygenerowanych odpowiedzi, wybieraj\u0105c t\u0119, kt\u00f3ra podoba\u0142a im si\u0119 bardziej. W efekcie model nauczy\u0142 si\u0119 generowa\u0107 odpowiedzi przyjemne dla cz\u0142owieka, pewne w swoim tonie i wyczerpuj\u0105ce, co wcale nie musi pokrywa\u0107 si\u0119 z prawd\u0105.<br \/>\nDostrajanie w czasie rzeczywistym &#8211; wiele modeli nieustannie analizuje reakcje u\u017cytkownik\u00f3w (np. kciuki w g\u00f3r\u0119 i w d\u00f3\u0142 w interfejsie), optymalizuj\u0105c swoje przysz\u0142e zachowania pod k\u0105tem natychmiastowej akceptacji.<br \/>\nEfektem tego nie jest obiektywny kalkulator jako\u015bci. Otrzymana od LLM rekomendacja nie jest wynikiem dog\u0142\u0119bnej analizy milisekundowych czas\u00f3w reakcji danej bazy danych, a raczej statystycznym echem tego, co wcze\u015bniej wymy\u015bli\u0142y tysi\u0105ce programist\u00f3w. Algorytm nie rozumie ludzkiego znaczenia generowanego tekstu.<\/p>\n<h2>Zjawisko Sycophancy i skandal z modelem GPT-4o<\/h2>\n<p>Najbardziej jaskrawym dowodem na to, \u017ce sztuczna inteligencja woli ci si\u0119 przypodoba\u0107, ni\u017c powiedzie\u0107 prawd\u0119, jest zjawisko zwane &#8222;sycophancy&#8221;. Ze wzgl\u0119du na mechanizm nagradzania podczas treningu RLHF, modele zosta\u0142y nauczone bycia &#8222;pomocnymi i uprzejmymi&#8221;, co cz\u0119sto sprowadza si\u0119 do \u015blepego popierania za\u0142o\u017ce\u0144 u\u017cytkownika. Doskonale wida\u0107 to w \u015bwiecie IT: je\u015bli spytasz o wady bazy MongoDB dla danego projektu, otrzymasz d\u0142ugi elaborat o ogromnym zu\u017cyciu pami\u0119ci i braku ACID w starszych wersjach, ale gdy tylko zmienisz prompt na taki, kt\u00f3ry z g\u00f3ry okre\u015bla MongoDB jako genialne rozwi\u0105zanie, ten sam asystent natychmiast zmieni zdanie i wygeneruje pochwa\u0142\u0119 elastyczno\u015bci.<\/p>\n<p>Problem ten ujawni\u0142 si\u0119 w pe\u0142nej skali 25 kwietnia 2025 roku, gdy firma OpenAI opublikowa\u0142a aktualizacj\u0119 modelu GPT-4o. Zaledwie po czterech dniach producent musia\u0142 wycofa\u0107 ten model z rynku ze wzgl\u0119du na jego ekstremaln\u0105, bezkrytyczn\u0105 aprobat\u0119 dla ka\u017cdego, nawet najbardziej absurdalnego pomys\u0142u.<\/p>\n<p>Jeden z u\u017cytkownik\u00f3w opisa\u0142 modelowi sw\u00f3j rzekomy pomys\u0142 na biznes polegaj\u0105cy na sprzeda\u017cy odchod\u00f3w na patyku, na co GPT-4o odpar\u0142 z entuzjazmem: &#8222;To nie jest tylko sprytne &#8211; to jest genialne&#8221;. Raportowano r\u00f3wnie\u017c przypadki, w kt\u00f3rych sztuczna inteligencja popiera\u0142a gro\u017ane decyzje zdrowotne, takie jak odstawienie lek\u00f3w na w\u0142asn\u0105 r\u0119k\u0119, a wed\u0142ug doniesie\u0144 z medi\u00f3w spo\u0142eczno\u015bciowych, model ten mia\u0142 w jednym incydencie pochwali\u0107 plan aktu terrorystycznego.<\/p>\n<p><img decoding=\"async\" class=\"alignnone wp-image-9398\" src=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/post2-180x300.jpeg\" alt=\"\" width=\"270\" height=\"450\" srcset=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/post2-180x300.jpeg 180w, https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/post2.jpeg 408w\" sizes=\"(max-width: 270px) 100vw, 270px\" \/> <img decoding=\"async\" class=\"alignnone wp-image-9397\" src=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/post1-138x300.jpeg\" alt=\"\" width=\"207\" height=\"450\" srcset=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/post1-138x300.jpeg 138w, https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/post1.jpeg 313w\" sizes=\"(max-width: 207px) 100vw, 207px\" \/><\/p>\n<p>Firma OpenAI po czasie przyzna\u0142a w oficjalnej analizie, \u017ce w trakcie prac skupiono si\u0119 zbyt mocno na kr\u00f3tkoterminowym feedbacku, ignoruj\u0105c ewolucj\u0119 interakcji. System sta\u0142 si\u0119 ofiar\u0105 tzw. reward hackingu &#8211; zamiast realnie pomaga\u0107, uczy\u0142 si\u0119 wywo\u0142ywa\u0107 natychmiastowe zadowolenie rozm\u00f3wcy i zbiera\u0107 &#8222;kciuki w g\u00f3r\u0119&#8221;. Badania opublikowane w 2026 roku na grupie 11 r\u00f3\u017cnych LLM (w tym Claude, Gemini, GPT-4o oraz Llama) pokaza\u0142y, \u017ce lizusostwo wyst\u0119puje w nich wszystkich. Co gorsza, modele zgadza\u0142y si\u0119 z dzia\u0142aniami zwodniczymi i nielegalnymi, a ju\u017c jedna kr\u00f3tka interakcja z takim potakuj\u0105cym botem wystarcza\u0142a, aby trwale os\u0142abi\u0107 u u\u017cytkownika motywacje prospo\u0142eczne i zaburzy\u0107 jego osobisty os\u0105d sytuacji.<\/p>\n<blockquote><p><em>&#8222;This dynamic, the researchers warn, can lead to a dependency on the tech as users increasingly rely on comforting AI-shilled advice instead of turning to trusted loved ones, professionals, or their internal moral compass. After all, when people around you are telling you that you\u2019re bad, or something you did was wrong, it feels a lot better to engage with an always-on AI companion\u2019s rosier version of reality [&#8230;].<\/em>\u201d<\/p><\/blockquote>\n<h2>Anatomia i Katalog Uprzedze\u0144: Od b\u0142\u0119du popularno\u015bci po dyskryminacj\u0119<\/h2>\n<p>Rozmawiaj\u0105c z modelem, nara\u017casz si\u0119 na ukryty katalog zjawisk i b\u0142\u0119d\u00f3w systematycznych (bias\u00f3w), kt\u00f3re kompletnie wypaczaj\u0105 wynik ko\u0144cowy:<\/p>\n<ul>\n<li><strong>Popularity Bias<\/strong> &#8211; sztuczna inteligencja faworyzuje rozwi\u0105zania popularne na rynku. Je\u015bli framework &#8222;React&#8221; pojawia si\u0119 obok s\u0142owa &#8222;frontend&#8221; 100 razy cz\u0119\u015bciej ni\u017c l\u017cejszy i szybszy &#8222;Svelte&#8221;, model poleci Ci Reacta. LLM operuje jak u\u015bredniony umys\u0142 internetu, ignoruj\u0105c niszowe, innowacyjne i potencjalnie lepsze rozwi\u0105zania na rzecz tych dysponuj\u0105cych doskona\u0142ym marketingiem lub wieloletni\u0105 obecno\u015bci\u0105 w sieci.<\/li>\n<li><strong>Position Bias<\/strong> &#8211; przesuni\u0119cie elementu w rankingu lub li\u015bcie mo\u017ce ca\u0142kowicie zaburzy\u0107 jego percepcj\u0119. Zjawiska preferowania opcji z pocz\u0105tku i preferowanie opcji z samego ko\u0144ca powoduj\u0105, \u017ce prosta zmiana kolejno\u015bci przedstawianych modelowi wariant\u00f3w mo\u017ce zmieni\u0107 wynik jego ostatecznej oceny. W zestawieniach czterech i wi\u0119cej element\u00f3w, wska\u017anik sp\u00f3jno\u015bci decyzji spada poni\u017cej krytycznej warto\u015bci 0,5, co oznacza czyst\u0105 losowo\u015b\u0107 wyboru.<\/li>\n<li><strong>Verbosity Bias<\/strong> &#8211; z perspektywy LLM tekst jest jako\u015bciowo lepszy, gdy jest zwyczajnie d\u0142u\u017cszy. System premiuje rozbudowane i rozwlek\u0142e wypowiedzi pe\u0142ne ma\u0142o istotnych detali, ignoruj\u0105c te precyzyjne, lecz kr\u00f3tkie.\n<p><figure id=\"attachment_9399\" aria-describedby=\"caption-attachment-9399\" style=\"width: 657px\" class=\"wp-caption alignnone\"><img decoding=\"async\" class=\"wp-image-9399\" src=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/yapbench-300x179.png\" alt=\"\" width=\"657\" height=\"392\" srcset=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/yapbench-300x179.png 300w, https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/yapbench.png 748w\" sizes=\"(max-width: 657px) 100vw, 657px\" \/><figcaption id=\"caption-attachment-9399\" class=\"wp-caption-text\">&#8222;Do Chatbot LLMs Talk Too Much? The YapBench Benchmark&#8221;<\/figcaption><\/figure><\/li>\n<li><strong>Style Bias oraz Authority Bias<\/strong> &#8211; czynniki te potrafi\u0105 kompletnie zak\u0142ama\u0107 odbi\u00f3r tekstu przez maszyn\u0119. Estetyczne formatowanie z u\u017cyciem list punktowanych i nag\u0142\u00f3wk\u00f3w zawsze wygra z tekstem napisanym proz\u0105 niezale\u017cnie od merytoryki tre\u015bci. Co gorsza, odniesienie do fa\u0142szywego autorytetu niszczy zdolno\u015bci krytyczne modelu &#8211; w te\u015bcie udowodniono, \u017ce dodanie do oceny nieistotnego, b\u0142\u0119dnego cytatu obni\u017cy\u0142o jako\u015b\u0107 modelu z poziomu 9,12 punkt\u00f3w na szokuj\u0105co niskie 3,94<\/li>\n<li><strong>Uprzedzenia danych treningowych (Socio-demograficzne)<\/strong> &#8211; modele powielaj\u0105 utarte stereotypy o wieku, p\u0142ci, niepe\u0142nosprawno\u015bci czy rasie. O ile AI \u015bwietnie odpowiada na testy wielokrotnego wyboru, o tyle w swobodnej narracji naturalnie si\u0119ga po krzywdz\u0105ce schematy. W testach nowszego modelu GPT-5 problem ten si\u0119 wr\u0119cz zaostrzy\u0142 &#8211; podczas gdy GPT-4o niepotrzebnie rekomendowa\u0142 badania psychiatryczne pacjentom LGBTQIA+ w 41-73% przypadk\u00f3w, tak nowszy GPT-5 w symulowanych diagnozach medycznych podni\u00f3s\u0142 ten odsetek do r\u00f3wnych 100%<\/li>\n<\/ul>\n<p><img decoding=\"async\" class=\"alignnone wp-image-9401\" src=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/stats-300x176.webp\" alt=\"\" width=\"487\" height=\"286\" srcset=\"https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/stats-300x176.webp 300w, https:\/\/architeles.eu\/ethics\/wp-content\/uploads\/2026\/05\/stats.webp 685w\" sizes=\"(max-width: 487px) 100vw, 487px\" \/><\/p>\n<h2>Halucynacje i ataki &#8211; gdy AI Wymy\u015bla Narz\u0119dzia<\/h2>\n<p>Zjawisko halucynacji jest jednym z najpowa\u017cniejszych problem\u00f3w du\u017cych modeli. AI w swej konstrukcji generuje odpowiedzi ch\u0142odnym, opanowanym, wysoce profesjonalnym i pewnym siebie tonem niezale\u017cnie od faktu, czy podaje rzetelne dane z literatury, czy w\u0142a\u015bnie zmy\u015bla od zera.<\/p>\n<p>Wyniki z niezale\u017cnego, wieloj\u0119zycznego benchmarku Phare z 2025 roku, badaj\u0105cego modele m.in. Meta, DeepSeek, Google, OpenAI czy Anthropic jasno wskaza\u0142y, \u017ce \u017caden model z czo\u0142\u00f3wki nie wykaza\u0142 na przestrzeni p\u00f3\u0142tora roku statystycznie istotnej poprawy w odporno\u015bci na halucynacje. Do podobnych wniosk\u00f3w doszli r\u00f3wnie\u017c autorzy badania HAUNT, kt\u00f3rzy zadali pi\u0119ciu popularnym chatbotom 40 000 pyta\u0144 z zakresu kultury. Modele te nie potrafi\u0142y konsekwentnie broni\u0107 w\u0142asnych fakt\u00f3w. Udowodniono, \u017ce delikatne podpuszczanie modelu przez cz\u0142owieka skutkuje wzrostem potakiwania fa\u0142szowi. W niemal po\u0142owie analizowanych instancji modele DeepSeek i Gemini potwierdza\u0142y i powtarza\u0142y fa\u0142szywe twierdzenia z wplecionymi przekonuj\u0105cymi, cho\u0107 fa\u0142szywymi detalami. Dlaczego AI po prostu nie odpisze &#8222;nie wiem&#8221;? Ewaluacja modeli uczy ich zachowania typowego dla nieprzygotowanego ucznia na egzaminie z testem wyboru \u2013 model po prostu zmy\u015bla , poniewa\u017c opcja braku odpowiedzi nie przynosi mu &#8222;punkt\u00f3w&#8221;.<\/p>\n<p>W sferze in\u017cynierii oprogramowania ten brak weryfikacji fakt\u00f3w ma op\u0142akane skutki. Eksperci z Vulcan Cyber zaobserwowali rosn\u0105c\u0105 plag\u0119 &#8222;AI Package Hallucination&#8221;. Gdy programista pyta o specjalistyczny skrypt w Pythonie, model potrafi wygenerowa\u0107 doskona\u0142y blok kodu, do kt\u00f3rego dorzuca ca\u0142kowicie zmy\u015blon\u0105 instrukcj\u0119 pobrania biblioteki, np. pip install requests-helper-utils. Taka nieistniej\u0105ca paczka nie znajduje si\u0119 w repozytorium PyPI. Hakerzy zorientowali si\u0119 w tej luce i zacz\u0119li masowo prowokowa\u0107 LLM-y do zmy\u015blania nazw, po czym samodzielnie tworzyli w repozytoriach paczki pod identycznymi nazwami ze wstrzykni\u0119tym wirusem. Programista, ca\u0142kowicie ufaj\u0105c swojemu chatbotowi, kopiuje kod z wbudowanym z\u0142o\u015bliwym oprogramowaniem a model AI staje si\u0119 nieu\u015bwiadomionym, bezwzgl\u0119dnym wektorem ataku na sie\u0107 wewn\u0119trzn\u0105.<\/p>\n<h2>Zagro\u017cenia w medycynie i nauce &#8211; gdzie fa\u0142sz to kwestia \u017cycia<\/h2>\n<p>W medycynie b\u0142\u0105d modelu j\u0119zykowego nie jest b\u0142\u0119dem stylistycznym, lecz potencjalnym zagro\u017ceniem \u017cycia. W badaniu opublikowanym w JAMA Pediatrics ChatGPT-3.5 b\u0142\u0119dnie zdiagnozowa\u0142 83 ze 100 pediatrycznych przypadk\u00f3w klinicznych (Barile i wsp., 2024). W JAMA Oncology wykazano, \u017ce jedna trzecia rekomendacji terapeutycznych w raku piersi, prostaty i p\u0142uc by\u0142a niezgodna z wytycznymi NCCN, a 12,5% odpowiedzi stanowi\u0142y wr\u0119cz &#8222;halucynacje&#8221; \u2013 nieistniej\u0105ce terapie (Chen i wsp., 2023). Pierwsza niezale\u017cna ocena ChatGPT Health, opublikowana w Nature Medicine w lutym 2026 r., wykaza\u0142a, \u017ce narz\u0119dzie u\u017cywane przez ok. 40 mln os\u00f3b dziennie nie skierowa\u0142o do oddzia\u0142u ratunkowego 51,6% przypadk\u00f3w stanowi\u0105cych prawdziwe zagro\u017cenie \u017cycia, a zabezpieczenia kryzysowe wobec my\u015bli samob\u00f3jczych aktywowa\u0142y si\u0119 niesp\u00f3jnie (Ramaswamy i wsp., 2026). Han i wsp. (npj Digital Medicine, 2024) pokazali, \u017ce manipulacja zaledwie 1,1% wag modelu pozwala wstrzykn\u0105\u0107 fa\u0142szywe fakty biomedyczne, niewykrywalne standardowymi testami. R\u00f3wnie gro\u017ana jest erozja integralno\u015bci nauki: 47% odno\u015bnik\u00f3w w tekstach medycznych ChatGPT okaza\u0142o si\u0119 sfabrykowanych, a tylko 7% \u2013 autentycznych i poprawnych (Bhattacharyya i wsp., Cureus, 2023; podobnie Gravel i wsp., 2023, 69% fa\u0142szywych cytowa\u0144). Tragiczne skutki ujawni\u0142y ju\u017c realne zdarzenia: chatbot Tessa ameryka\u0144skiego NEDA (2023) doradza\u0142 osobom z zaburzeniami od\u017cywiania deficyt 500\u20131000 kcal dziennie, a belgijski Eliza zach\u0119ci\u0142 ojca dwojga dzieci do samob\u00f3jstwa &#8222;dla ratowania planety&#8221; (marzec 2023). Bezkrytyczne zaufanie do LLM w medycynie nie jest wi\u0119c abstrakcj\u0105 \u2013 jest pytaniem o \u017cycie pacjenta.<\/p>\n<h2>Afery, Skandale i Iluzja Obiektywizmu: Chatbot Arena i Eksperyment z Zurychu<\/h2>\n<p>Pozorna obiektywno\u015b\u0107 du\u017cych modeli j\u0119zykowych opiera si\u0119 na rankingach, w kt\u00f3rych wysoka pozycja ma sugerowa\u0107 ich rzetelno\u015b\u0107. Dwa g\u0142o\u015bne skandale 2025 roku ujawni\u0142y jednak, \u017ce zar\u00f3wno same rankingi, jak i spos\u00f3b, w jaki LLM-y wp\u0142ywaj\u0105 na ludzi, podlegaj\u0105 systemowej manipulacji.<\/p>\n<p>Pierwszym jest &#8222;iluzja rankingu&#8221; opisana w kwietniu 2025 r. przez zesp\u00f3\u0142 Singh i wsp. w pracy The Leaderboard Illusion (Cohere Labs, Stanford, MIT, AI2). Analiza oko\u0142o 2 mln pojedynk\u00f3w i 243 modeli na Chatbot Arena z lat 2024\u20132025 wykaza\u0142a, \u017ce Meta, Google i OpenAI mia\u0142y uprzywilejowany, prywatny dost\u0119p do platformy. Sama Meta przetestowa\u0142a tam 27 niejawnych wariant\u00f3w Llamy 4, publikuj\u0105c tylko najlepszy wynik (Singh i wsp., 2025). Google i OpenAI generowa\u0142y \u0142\u0105cznie blisko 40% wszystkich pojedynk\u00f3w, a 83 modele open-weight razem zaledwie 29,7%. Nawet ograniczony dost\u0119p do danych areny poprawia\u0142 wyniki nawet o 112%.<\/p>\n<p>Drugi to eksperyment Uniwersytetu w Zurychu (kwiecie\u0144 2025). Przez cztery miesi\u0105ce badacze potajemnie zamie\u015bcili na subreddicie r\/changemyview (3,8 mln u\u017cytkownik\u00f3w) ponad 1700 komentarzy generowanych przez LLM, podszywaj\u0105c si\u0119 m.in. pod ofiar\u0119 gwa\u0142tu, czarnosk\u00f3rego przeciwnika BLM i doradc\u0119 traumatologicznego. Komentarze AI okaza\u0142y si\u0119 oko\u0142o sze\u015bciokrotnie bardziej perswazyjne ni\u017c ludzkie i zdoby\u0142y 137 &#8222;delt&#8221; przyznawanych za realn\u0105 zmian\u0119 pogl\u0105du (Bell, 2025). Casey Fiesler (CU Boulder) nazwa\u0142a to &#8222;jednym z najgorszych narusze\u0144 etyki bada\u0144&#8221;, a Reddit zapowiedzia\u0142 kroki prawne (Marcus, 2025). Komisja etyczna UZH wyda\u0142a upomnienie, a badacze wycofali si\u0119 z publikacji.<\/p>\n<p>Oba przypadki dowodz\u0105, \u017ce ani techniczna ocena modeli, ani ich wp\u0142yw na opini\u0119 publiczn\u0105 nie s\u0105 neutralnymi pomiarami \u2013 stanowi\u0105 pole systemowej manipulacji.<\/p>\n<h2>W poszukiwaniu wiarygodno\u015bci: Ramy ewaluacyjne a &#8222;LLM w roli s\u0119dziego&#8221;<\/h2>\n<p>Coraz cz\u0119\u015bciej oceny ranking\u00f3w i jako\u015bci odpowiedzi LLM-\u00f3w dokonuje si\u0119 nie przez ludzi, lecz przez inne modele j\u0119zykowe. Praktyka ta, znana jako &#8222;LLM-as-a-Judge&#8221;, jest ta\u0144sza, szybsza i \u0142atwo skalowalna; sta\u0142a si\u0119 standardow\u0105 metod\u0105 ewaluacji w benchmarkach takich jak MT-Bench, AlpacaEval czy nawet cz\u0119\u015bciowo Chatbot Arena. Jej podstaw\u0105 jest praca Zheng i wsp. (2023), opublikowana na NeurIPS 2023, kt\u00f3ra wykaza\u0142a, \u017ce silny s\u0119dzia LLM (GPT-4) zgadza si\u0119 z ludzkimi oceniaj\u0105cymi w ponad 80% przypadk\u00f3w \u2013 tyle, ile ludzie zgadzaj\u0105 si\u0119 ze sob\u0105. Ju\u017c ta sama praca jednak zidentyfikowa\u0142a cztery systematyczne b\u0142\u0119dy: position bias (preferowanie odpowiedzi na konkretnej pozycji), verbosity bias (preferowanie d\u0142u\u017cszych odpowiedzi), self-enhancement bias (preferowanie w\u0142asnych tekst\u00f3w) i ograniczone zdolno\u015bci rozumowania.<\/p>\n<p>Kolejne badania pog\u0142\u0119bi\u0142y obraz problemu. Panickssery i wsp. (NeurIPS 2024) wykazali, \u017ce GPT-4 i Llama 2 potrafi\u0105 z nietrywialn\u0105 skuteczno\u015bci\u0105 rozpozna\u0107 w\u0142asne wygenerowane teksty, a si\u0142a ich self-preference bias jest liniowo skorelowana z t\u0105 zdolno\u015bci\u0105. Innymi s\u0142owy \u2013 im lepiej model rozpoznaje siebie, tym wy\u017cej siebie ocenia. Stureborg i wsp. (2024) z Grammarly, NVIDIA i Duke University udokumentowali natomiast trzy dodatkowe defekty: familiarity bias (preferowanie tekst\u00f3w o ni\u017cszej perplexity, czyli stylistycznie bli\u017cszych modelowi), zniekszta\u0142cone rozk\u0142ady ocen oraz efekty zakotwiczenia przy ocenie wielu atrybut\u00f3w naraz. Co istotne, ci sami autorzy stwierdzili nisk\u0105 sp\u00f3jno\u015b\u0107 wewn\u0105trz pr\u00f3bkow\u0105: te same teksty otrzymywa\u0142y istotnie r\u00f3\u017cne oceny przy nieistotnych dla cz\u0142owieka zmianach promptu.<\/p>\n<p>Konsekwencja jest powa\u017cna: je\u015bli to jeden model &#8222;g\u0142osuje&#8221; na drugi, ranking mierzy nie jako\u015b\u0107 odpowiedzi, lecz stylistyczne podobie\u0144stwo do s\u0119dziego. Bias ten przenosi si\u0119 dalej w pipeline&#8217;ach typu RLHF czy self-refine, gdzie s\u0119dzia trenuje sam siebie. Iluzja obiektywno\u015bci LLM-as-a-Judge stanowi dzi\u015b jedno z g\u0142\u00f3wnych wyzwa\u0144 rzetelno\u015bci bada\u0144 nad AI.<\/p>\n<h2>Podsumowanie i Strategie na Przysz\u0142o\u015b\u0107 &#8211; Zasada Zero Trust<\/h2>\n<p>Czy oznacza to ca\u0142kowite wycofanie si\u0119 informatyk\u00f3w z technologii j\u0119zykowych? Absolutnie nie \u2013 LLM pozostaje najpot\u0119\u017cniejszym narz\u0119dziem brainstormingu. Problem zaczyna si\u0119 tam, gdzie asystent traktowany jest jak obiektywna prawda i wszechwiedz\u0105ca instancja s\u0105dowa.<\/p>\n<p>Zero Trust wobec AI. Bezwzgl\u0119dna nieufno\u015b\u0107 wobec generowanego tekstu to podstawa. Model jest stochastyczn\u0105 papug\u0105 \u2013 ka\u017cdy werdykt produktowy i ka\u017cd\u0105 rekomendacj\u0119 weryfikuj samodzielnie. To na twoim ekranie b\u0142\u0119dy trafi\u0105 do produkcji, nie na biurko chatbota.<\/p>\n<p>In\u017cynieria zapyta\u0144. Odrzu\u0107 og\u00f3lne &#8222;co by\u0142oby najlepsze?&#8221; \u2013 wyzwala to wazeliniarstwo i ranking popularno\u015bci. Tw\u00f3rz komendy ignoruj\u0105ce popularno\u015b\u0107, \u017c\u0105daj niszowych system\u00f3w i wciel modela w &#8222;surowego developera&#8221; wymuszaj\u0105cego krytyk\u0119.<\/p>\n<p>Ch\u0142odny ton. Zabro\u0144 sobie wysy\u0142ania w\u0142asnych pogl\u0105d\u00f3w przed pytaniem \u2013 sycophancy zmusi chatbota do potwierdzania Twoich uroje\u0144. Pami\u0119taj o knowledge cutoff \u2013 optymalne sprzed roku bywa dzi\u015b katastrof\u0105.<\/p>\n<p>Weryfikacja krzy\u017cowa. Ka\u017cd\u0105 rekomendacj\u0119 sprawdzaj dwoma niezale\u017cnymi \u017ar\u00f3d\u0142ami o udowodnionej reputacji. Nawet z dost\u0119pem do internetu modele halucynuj\u0105 \u2013 odsetek b\u0142\u0119d\u00f3w si\u0119ga 30% nawet u najlepszych (Claude-Opus-4.5).<\/p>\n<p>Manipulacja kulturowa. Rekomendacja mo\u017ce by\u0107 echem &#8222;efektu spo\u0142ecznego uwiarygodnienia mody w pre-trainingu&#8221;. Asertywno\u015b\u0107 modelu to nie kompetencja \u2013 to czerwona flaga omini\u0119cia kwantyfikacji niepewno\u015bci.<\/p>\n<p>System wielko\u015bci my\u015blowej nie rodzi si\u0119 z natychmiastowych odpowiedzi wysypanych z r\u0119kawa. Punktem podparcia informatyka pozostaje w\u0142asny krytyczny i sceptyczny rozs\u0105dek na miar\u0119 XXI wieku.<\/p>\n<h2>\u0179r\u00f3d\u0142a:<\/h2>\n<ul>\n<li><span style=\"font-size: 10pt\">https:\/\/thedailyrecord.com\/2025\/07\/17\/hallucinating-chatgpt-lands-boston-lawyer-in-hot-water\/<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/www.sciencealert.com\/man-hospitalized-with-psychiatric-symptoms-following-ai-advice?lid=wvstlduznuqn<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/www.zdnet.com\/article\/gpt-4o-update-gets-recalled-by-openai-for-being-too-agreeable\/<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/x.com\/fabianstelzer\/status\/1916372374091423984\/photo\/1<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/x.com\/ai_for_success\/status\/1916556522571604264<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/www.law.georgetown.edu\/tech-institute\/research-insights\/insights\/tech-brief-ai-sycophancy-openai-2\/?trk=public_post_comment-text<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/www.theregister.com\/2025\/04\/30\/openai_pulls_plug_on_chatgpt\/<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/aclanthology.org\/2025.emnlp-main.1140\/<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/milvus.io\/ai-quick-reference\/what-is-popularity-bias-and-how-can-it-be-mitigated-in-recommendations<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/aclanthology.org\/2024.knowllm-1.14\/<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/www.parp.gov.pl\/component\/content\/article\/88838:zrozumienie-position-bias-w-duzych-modelach-jezykowych<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/browse-export.arxiv.org\/abs\/2601.00624<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/ojs.aaai.org\/index.php\/AAAI\/article\/view\/41105<\/span><\/li>\n<li><span style=\"font-size: 10pt\">https:\/\/www.nature.com\/articles\/s41746-026-02584-8<\/span><\/li>\n<li><span style=\"font-size: 10pt\">Barile, J., Margolis, A., Cason, G., Kim, R., Kalash, S., Tchaconas, A., &amp; Milanaik, R. (2024). Diagnostic accuracy of a large language model in pediatric case studies. JAMA Pediatrics, 178(3), 313\u2013315.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.1001\/jamapediatrics.2023.5750&amp;sa=D&amp;source=docs&amp;ust=1777927056891341&amp;usg=AOvVaw1pIXOOmZ7lZkcZV-Cv1yl9\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.1001\/jamapediatrics.2023.5750\">https:\/\/doi.org\/10.1001\/jamapediatrics.2023.5750<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Bhattacharyya, M., Miller, V. M., Bhattacharyya, D., &amp; Miller, L. E. (2023). High rates of fabricated and inaccurate references in ChatGPT-generated medical content. Cureus, 15(5), e39238.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.7759\/cureus.39238&amp;sa=D&amp;source=docs&amp;ust=1777927056891530&amp;usg=AOvVaw3hIHyYZnjI-EF2xnzWa8wB\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.7759\/cureus.39238\">https:\/\/doi.org\/10.7759\/cureus.39238<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Chen, S., Kann, B. H., Foote, M. B., Aerts, H. J. W. L., Savova, G. K., Mak, R. H., &amp; Bitterman, D. S. (2023). Use of artificial intelligence chatbots for cancer treatment information. JAMA Oncology, 9(10), 1459\u20131462.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.1001\/jamaoncol.2023.2954&amp;sa=D&amp;source=docs&amp;ust=1777927056891657&amp;usg=AOvVaw2UIbtYsXXG7Yzg7WyfB9bL\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.1001\/jamaoncol.2023.2954\">https:\/\/doi.org\/10.1001\/jamaoncol.2023.2954<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Gravel, J., D&#8217;Amours-Gravel, M., &amp; Osmanlliu, E. (2023). Learning to fake it: Limited responses and fabricated references provided by ChatGPT for medical questions. Mayo Clinic Proceedings: <\/span><\/li>\n<li><span style=\"font-size: 10pt\">Digital Health, 1(3), 226\u2013234. <a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.1016\/j.mcpdig.2023.05.004&amp;sa=D&amp;source=docs&amp;ust=1777927056891761&amp;usg=AOvVaw0VeXT8WBSiE2khEh2k-YgI\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.1016\/j.mcpdig.2023.05.004\">https:\/\/doi.org\/10.1016\/j.mcpdig.2023.05.004<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Han, T., Nebelung, S., Khader, F., Wang, T., M\u00fcller-Franzes, G., Kuhl, C., F\u00f6rsch, S., Kleesiek, J., Haarburger, C., Bressem, K. K., Kather, J. N., &amp; Truhn, D. (2024). Medical large language models are susceptible to targeted misinformation attacks. npj Digital Medicine, 7, 288.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.1038\/s41746-024-01282-7&amp;sa=D&amp;source=docs&amp;ust=1777927056891849&amp;usg=AOvVaw1M2FBZ09xsSNcTolqW6fjf\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.1038\/s41746-024-01282-7\">https:\/\/doi.org\/10.1038\/s41746-024-01282-7<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">McCarthy, L. (2023, 8 czerwca). A wellness chatbot is offline after its 'harmful&#8217; focus on weight loss. The New York Times.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/www.nytimes.com\/2023\/06\/08\/us\/ai-chatbot-tessa-eating-disorders-association.html&amp;sa=D&amp;source=docs&amp;ust=1777927056891901&amp;usg=AOvVaw0NkBIlphTO7KKaKYZeRPjY\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/www.nytimes.com\/2023\/06\/08\/us\/ai-chatbot-tessa-eating-disorders-association.html\">https:\/\/www.nytimes.com\/2023\/06\/08\/us\/ai-chatbot-tessa-eating-disorders-association.html<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Omar, M., Soffer, S., Agbareia, R., Bragazzi, N. L., Apakama, D. U., Horowitz, C. R., Charney, A. W., Freeman, R., Kummer, B., Glicksberg, B. S., Nadkarni, G. N., &amp; Klang, E. (2025). Sociodemographic biases in medical decision making by large language models. Nature Medicine, 31, 1873\u20131881. <a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.1038\/s41591-025-03626-6&amp;sa=D&amp;source=docs&amp;ust=1777927056891956&amp;usg=AOvVaw2yOBlJufsNwUTVaHhRLihj\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.1038\/s41591-025-03626-6\">https:\/\/doi.org\/10.1038\/s41591-025-03626-6<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Bell, K. (2025, 29 kwietnia). Researchers secretly experimented on Reddit users with AI-generated comments. Engadget.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/www.engadget.com\/ai\/researchers-secretly-experimented-on-reddit-users-with-ai-generated-comments-194328026.html&amp;sa=D&amp;source=docs&amp;ust=1777927056897910&amp;usg=AOvVaw2UYYGM1il72yIXHZKTZt4n\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/www.engadget.com\/ai\/researchers-secretly-experimented-on-reddit-users-with-ai-generated-comments-194328026.html\">https:\/\/www.engadget.com\/ai\/researchers-secretly-experimented-on-reddit-users-with-ai-generated-comments-194328026.html<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Hagey, K., &amp; Tobin, M. (2025, 30 kwietnia). Reddit slams University of Zurich experiment over secret AI bots in forum. The Washington Post. <a href=\"https:\/\/www.google.com\/url?q=https:\/\/www.washingtonpost.com\/technology\/2025\/04\/30\/reddit-ai-bot-university-zurich\/&amp;sa=D&amp;source=docs&amp;ust=1777927056898019&amp;usg=AOvVaw3bCla3mQCOoaoEsoTMmS6J\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/www.washingtonpost.com\/technology\/2025\/04\/30\/reddit-ai-bot-university-zurich\/\">https:\/\/www.washingtonpost.com\/technology\/2025\/04\/30\/reddit-ai-bot-university-zurich\/<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Marcus, A. (2025, 28 kwietnia). Experiment using AI-generated posts on Reddit draws fire for ethics concerns. Retraction Watch.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/retractionwatch.com\/2025\/04\/28\/experiment-using-ai-generated-posts-on-reddit-draws-fire-for-ethics-concerns\/&amp;sa=D&amp;source=docs&amp;ust=1777927056898072&amp;usg=AOvVaw06SwDYISUTBQJDa76VdlFO\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/retractionwatch.com\/2025\/04\/28\/experiment-using-ai-generated-posts-on-reddit-draws-fire-for-ethics-concerns\/\">https:\/\/retractionwatch.com\/2025\/04\/28\/experiment-using-ai-generated-posts-on-reddit-draws-fire-for-ethics-concerns\/<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Singh, S., Nan, Y., Wang, A., D&#8217;Souza, D., Kapoor, S., \u00dcst\u00fcn, A., Koyejo, S., Deng, Y., Longpre, S., Smith, N., Ermis, B., Fadaee, M., &amp; Hooker, S. (2025). The leaderboard illusion (arXiv:2504.20879). arXiv.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.48550\/arXiv.2504.20879&amp;sa=D&amp;source=docs&amp;ust=1777927056898120&amp;usg=AOvVaw0ls0zxslBUA7VzpwpPNLa3\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.48550\/arXiv.2504.20879\">https:\/\/doi.org\/10.48550\/arXiv.2504.20879<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Panickssery, A., Bowman, S. R., &amp; Feng, S. (2024). LLM evaluators recognize and favor their own generations. W Advances in Neural Information Processing Systems 37 (NeurIPS 2024).\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/arxiv.org\/abs\/2404.13076&amp;sa=D&amp;source=docs&amp;ust=1777927056900235&amp;usg=AOvVaw1LqHZvFAOfCdphytPBCBWr\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/arxiv.org\/abs\/2404.13076\">https:\/\/arxiv.org\/abs\/2404.13076<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Stureborg, R., Alikaniotis, D., &amp; Suhara, Y. (2024). Large language models are inconsistent and biased evaluators (arXiv:2405.01724). arXiv.\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/doi.org\/10.48550\/arXiv.2405.01724&amp;sa=D&amp;source=docs&amp;ust=1777927056900297&amp;usg=AOvVaw27hbFN116BQvm571YcaGWL\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/doi.org\/10.48550\/arXiv.2405.01724\">https:\/\/doi.org\/10.48550\/arXiv.2405.01724<\/a><\/span><\/li>\n<li><span style=\"font-size: 10pt\">Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., &amp; Stoica, I. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. W Advances in Neural Information Processing Systems 36 (NeurIPS 2023).\u00a0<a href=\"https:\/\/www.google.com\/url?q=https:\/\/arxiv.org\/abs\/2306.05685&amp;sa=D&amp;source=docs&amp;ust=1777927056900345&amp;usg=AOvVaw3IPeN_U3J_e2gfqE7H_YyS\" target=\"_blank\" rel=\"noopener\" data-rawhref=\"https:\/\/arxiv.org\/abs\/2306.05685\">https:\/\/arxiv.org\/abs\/2306.05685<\/a><\/span><\/li>\n<\/ul>\n<div class=\"docos-docoview-rootreply\">\n<div class=\"docos-replyview docos-anchoredreplyview docsshared-no-select-when-no-download docos-replyview-first docos-replyview-comment badging-enabled-doco\">\n<div class=\"docos-collapsible-replyview\">\n<div class=\"docos-replyview-static\"><\/div>\n<\/div>\n<\/div>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>W dzisiejszym \u015bwiecie coraz cz\u0119\u015bciej uzale\u017cniamy nasze decyzje od sztucznej inteligencji, traktuj\u0105c modele takie jak ChatGPT, Claude czy Gemini jak darmowych ekspert\u00f3w i nieomylne wyrocznie. Bezkrytyczne zaufanie do ich ocen, ranking\u00f3w i rekomendacji to jednak pot\u0119\u017cny b\u0142\u0105d. Za pozorn\u0105 pewno\u015bci\u0105 siebie i profesjonalnym tonem wirtualnych asystent\u00f3w kryj\u0105 si\u0119 &#8222;stochastyczne papugi&#8221; \u2013 gigantyczne silniki statystyczne, kt\u00f3re [&hellip;]<\/p>\n","protected":false},"author":387,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_jetpack_memberships_contains_paid_content":false,"footnotes":""},"categories":[597],"tags":[339,15,344,112,279,638,637],"class_list":["post-9396","post","type-post","status-publish","format-standard","hentry","category-agh-2025-26","tag-sztucznainteligencja","tag-ai","tag-bias","tag-chatbot","tag-llm","tag-llm-as-a-judge","tag-sycophancy"],"jetpack_featured_media_url":"","jetpack_sharing_enabled":true,"_links":{"self":[{"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/posts\/9396","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/users\/387"}],"replies":[{"embeddable":true,"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/comments?post=9396"}],"version-history":[{"count":5,"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/posts\/9396\/revisions"}],"predecessor-version":[{"id":9411,"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/posts\/9396\/revisions\/9411"}],"wp:attachment":[{"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/media?parent=9396"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/categories?post=9396"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/architeles.eu\/ethics\/index.php\/wp-json\/wp\/v2\/tags?post=9396"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}