Rdzeń pomiaru jakości debaty parlamentarnej: Discourse Quality Index Steenbergena i Bächtigera, jego rewizja DQI-2 oraz operacjonalizacja LLM-owa AQuA. Stąd biorą się cechy „merytoryczność”, „na temat”, „kultura debaty” i „interaktywność”.
DQI wywodzi się z etyki dyskursu Habermasa i mierzy deliberację typu I - racjonalną wymianę uzasadnień zmierzającą do konsensusu wokół roszczeń ważnościowych. Pięć rdzeniowych konstruktów oryginalnego DQI (Steenbergen, Bächtiger, Spörndli, Steiner 2003):
Czy mówca mógł swobodnie wyrazić stanowisko - oryginalnie operacjonalizowane przez przerwania (interruptions) uniemożliwiające wypowiedź, inne niż normalne limity czasowe. W rewizji: równość = udział w liczbie i czasie wypowiedzi (kto i ile faktycznie mówi).
W jakim stopniu mówca łączy twierdzenie z powodami (linkage powód→konkluzja) i czyni je dostępnym dla racjonalnej krytyki. To rdzeń Habermasowski - najlepszy kandydat do oceny LLM-em, o najwyższej rzetelności u koderów.
Czy argument odwołuje się do wąskiego interesu grupy/wyborców, czy do dobra wspólnego - w ujęciu utylitarnym („najlepsze dla największej liczby ludzi”) lub wg zasady różnicy Rawlsa (troska o najsłabszych).
Uznanie dla innych w trzech pod-wymiarach: szacunek wobec grup (zwł. tych, których dotyczy debata), wobec żądań/wniosków innych i wobec kontrargumentów.
Czy mówca trwa przy swojej pozycji, czy proponuje rozwiązania mediujące/kompromisowe - orientacja na konsensus.
Krytyka oryginału: zbyt wąsko Habermasowski (pomija deliberację typu II - narrację, retorykę, świadectwo, negocjację), brak progów/cut-off (indeks tylko porównawczy), a empirycznie wymiary nie korelują ze sobą (śr. korelacja ≈ 0,12 na poziomie mówców) - to różne, niesprowadzalne do jednego skoru cechy. DQI-2 dodaje: interactivity / reciprocity (czy wypowiedź realnie odnosi się do wcześniejszych), storytelling (osobiste świadectwo jako prawomocny wkład) oraz łączy „respect toward demands” i „toward counterarguments” w jeden wskaźnik.
Niemeyer i Dryzek mierzą nie cechy pojedynczej wypowiedzi, lecz intersubiektywną spójność całej grupy (metakonsensus) metodą Q-methodology - sortowanie twierdzeń i ranking opcji przez uczestników. Wymaga danych ankietowych przed/po, więc z samego transkryptu policzyć się nie da i do automatycznej oceny pojedynczej wypowiedzi się nie nadaje. Zostawiamy jako kontekst pojęciowy (cel deliberacji = spójność rozumowania grupy).
Jednostka analizy = „speech” - pojedyncza, dyskretna wypowiedź konkretnego posła w konkretnym momencie debaty, zawierająca demand (żądanie/wniosek). Kodujemy wypowiedź, nie zdanie i nie całą debatę (debata = agregat). Oryginalny DQI raportuje ~91,5% zgodności koderów - schemat jest replikowalny.
Lord & Tamvaki kodują 6 wskaźników na poziomie pojedynczej wypowiedzi: (1) Respect & Recognition (wobec uczestników i wobec ich argumentów - indeks niski/średni/wysoki); (2) Justification level (0/1/2 powodów); (3) Justification completeness (interesy/wartości/prawa); (4) Justification inclusiveness (dobro wspólne narodowe/europejskie/globalne); (5) Justification consequentiality - czy mówca daje i/lub żąda rozliczenia (accountability). Wskaźniki traktowano osobno, bo nie tworzyły jednowymiarowej skali (α≈0,47, poniżej 0,7).
Najbardziej wprost użyteczna dla Sejmu. Rozkłada jakość na ~20 binarnych adapterów w 3 wymiarach + storytelling, jednostka = pojedynczy komentarz/wypowiedź:
Agregacja: ważona suma adapterów (wagi = korelacja oceny eksperta z oceną nie-eksperta „czy wypowiedź wzbogaca dyskusję”), normalizacja do skali 0–5. Rzetelność koderów eksperckich: średnie Krippendorff α ≈ 0,83 (próg 0,67); walidacja zewnętrzna F1≈81,7 dla „constructiveness” (SOCC).
Do oceny pojedynczej wypowiedzi nadają się: poziom uzasadniania (0–4), orientacja na dobro wspólne, szacunek / cywilność, interaktywność (wymaga kontekstu przedmówców), polityka konstruktywna, accountability oraz relevance i fakt vs. opinia. Odpuszczamy participation/equality (to metryka agregatu, nie tekstu) oraz DRI/metakonsensus (wymaga ankiet). Kluczowe pułapki: wymiary są ortogonalne (NIE sprowadzać do jednego „score jakości”); odróżnić cytat od własnej tezy (inaczej zawyżone justification); ironia/sarkazm grożą false-positive przy respect; rytualna grzeczność („Wysoka Izbo”) ≠ szacunek merytoryczny, a frazesy o narodzie ≠ realna orientacja na dobro wspólne; DQI jest miarą porównawczą (relatywną), nie absolutną - rzetelność LLM vs. człowiek trzeba zmierzyć, nie założyć.