Jak naukowo oceniać strukturę argumentu i wykrywać błędy logiczne: model Toulmina, pragma-dialektyka (błąd = naruszenie reguły dyskusji), taksonomia MAFALDA i schematy Waltona. Stąd bierze się cecha „czystość logiczna”.
Argument rozkłada się na komponenty, których obecność/jakość można oceniać:
W argument mining zwykle anotuje się tylko claim + premise + relacje(support/attack) - pełny Toulmin jest zbyt subtelny dla anotatorów (Habernal & Gurevych 2017).
U van Eemerena i Grootendorsta błąd to nie wada formy, lecz „chwyt wykolejający” (derailment) rozsądnego rozwiązania sporu - ruch naruszający jedną z 10 reguł krytycznej dyskusji. Definicja jest proceduralna i kontekstowa: ten sam zwrot bywa poprawny lub błędny zależnie od etapu i funkcji w dyskusji. To daje najlepiej obronialny „rubryk”, bo każdy błąd ma jawne uzasadnienie („narusza regułę X”). Reguła 1 (wolności) → ad baculum, ad hominem; reguła 3 (stanowiska) → strawman; reguła 4 (relewancji) → ad populum, ignoratio elenchi; reguła 6 (punktów wyjścia) → petitio principii, false dilemma; reguła 7 (schematu) → hasty generalization, slippery slope, post hoc; reguła 10 (języka) → equivocation.
Argumenty nie-dedukcyjne (presumpcyjne) mają stereotypowe wzorce (~25–30 schematów: z autorytetu, z analogii, z konsekwencji, z przykładu). Każdy schemat ma zestaw pytań krytycznych (CQs), których odpowiedzi rozstrzygają poprawność. Błąd = schemat użyty bez zaspokojenia pytań krytycznych. Najnowszy kierunek (CQs-Gen): LLM generuje pytanie krytyczne zamiast etykietować błąd - etykiety jakości: Useful / Unhelpful / Invalid.
Trzy skończone listy nazwanych błędów: LOGIC (Jin et al. 2022, 13 typów), MAFALDA (Helwe et al. 2024, hierarchia 3-poziomowa, ~22 typy w 3 rodzinach: Emocji / Logiki / Wiarygodności) oraz ElecDeb60To16 (Goffredo et al., 6 typów pod debaty polityczne: Ad Hominem, Appeal to Authority, Appeal to Emotion, False Cause, Slippery Slope, Slogan). MAFALDA jest najlepiej operacjonalizowalna dla LLM - każdy błąd ma definicję nieformalną + szablon formalny ze zmiennymi (E=podmiot, P=przesłanka, C=wniosek) + przykład.
Wzbudzanie emocji (gniew, panika, współczucie) zamiast podania powodu - np. „Jeśli P1, stanie się coś strasznego”.
Zniekształcenie tezy przeciwnika tak, by wydała się absurdalna, i wyśmianie jej zamiast obalenia.
„Po co zajmować się P1, skoro istnieje gorszy P2” - odwrócenie uwagi przez porównanie wagi problemów.
Przypisanie jednej przyczyny, choć skutek ma wiele przyczyn (P1 spowodował C, choć P2, P3 też).
Następstwo czasowe brane za związek przyczynowy (P skojarzone czasowo z C → P powoduje C).
Wniosek uzasadniony przesłanką, która sama zakłada wniosek (C bo P; P bo C, lub C bo C).
Ten sam termin użyty w dwóch różnych znaczeniach (M1, potem M2), co fałszuje wnioskowanie.
„E1 jak E2; E2 ma cechę P → E1 ma P”, choć E1 i E2 różnią się w istotnym aspekcie.
„Albo P1, albo P2”, choć istnieją inne możliwości.
Wniosek o całej populacji z próbki zbyt małej lub niereprezentatywnej.
„P1 → P2 → P3 → … → C negatywne” bez wykazania nieuchronności kolejnych kroków.
Podstawienie zniekształconej wersji tezy przeciwnika i obalenie jej zamiast oryginału.
„E ma cechę P → część E1 ma P” - błędne przeniesienie własności całości na część.
Atak na charakter osoby (A) zamiast na jej tezę (E twierdzi P; atak na E → ¬P).
„Wielu wierzy P → P” - popularność brana za dowód prawdziwości.
„E to autorytet, więc P” - przy czym konsensus naukowy NIE jest błędem.
„Bo tak jest naturalnie / bo tak było zawsze” jako jedyny powód.
Dyskredytacja tezy przez powiązanie jej z grupą znienawidzoną przez audytorium.
„E twierdzi P, ale sam działa jak ¬P → ¬P” - odbicie zarzutu zamiast odpowiedzi na meritum.
Jednostka = span tekstu (fragment, niekoniecznie całe zdanie). Schemat dysjunktywny: anotator może przypisać kilka dopuszczalnych etykiet naraz (np. „causal oversimplification LUB false causality”), bo anotacja błędów jest z natury subiektywna - gold standard to zbiór dopuszczalnych etykiet, a ewaluacja nie karze za wybór dowolnej z nich. Najlepszy model (GPT-3.5) osiągał na MAFALDA F1 ~0,18 dla pełnej klasyfikacji, ludzie ~0,35 - zadanie jest trudne nawet dla ludzi, co nakazuje kalibrację pewności. W ElecDeb60To16 Slogan, Appeal to Emotion i Ad Hominem dzielą słownictwo i rejestr emocjonalny, więc są mylone - ostrzeżenie dla automatu.
Wysoka wykonalność na samym tekście: obecność struktury argumentu (Toulmin-lite), błędy emocjonalne, false dilemma, slippery slope, hasty generalization, false cause, circular reasoning, Slogan. Średnia (wymaga kontekstu): ad hominem vs. uprawniona krytyka kompetencji, appeal to authority (konsensus naukowy NIE jest błędem), tu quoque. Zalecenia: rozdziel strukturę argumentu (pozytywną, gradacyjną) od obecności błędów (negatywnej, etykietowej) - nie mieszać w jeden wynik; stosuj schemat dysjunktywny (zbiór etykiet + pewność); dodaj pytania krytyczne Waltona zamiast twardej etykiety przy autorytecie/analogii; każda etykieta z cytatem-spanem i mapowaniem na regułę pragma-dialektyki. Pułapki: emocja/patos to norma gatunkowa (oceniać dominację chwytu, nie sam fakt emocji); ironia (LLM bierze ją dosłownie); cytat vs. własna teza (poseł demaskujący cudzy błąd go nie popełnia); strawman bez dostępu do oryginału stanowiska; whataboutism bywa uprawnionym zarzutem hipokryzji.