Was in den Korpora auffällig ist – gemessen, nicht geschätzt.
Diese Seite prüft nicht die Zuordnungen (das tut die Review-Queue), sondern die Wissensbasis selbst: ist der Text, gegen den gesucht wird, überhaupt sauber eingelesen? Ein Fehler hier verfälscht jedes Ergebnis, das darauf aufbaut, und ist von außen unsichtbar.
6101 Passagen aus 19 Bänden. Länge: kürzeste 120, Median 1182, längste 2639 Zeichen. Die Homogenität ist das eigentlich Gute daran – ein Korpus mit stark schwankenden Einheiten liefert schwankende Ähnlichkeitswerte, und die Schwelle BELEG_MIN_SCORE (0.4) wäre dann bedeutungslos.
| Band | Passagen | Ø Zeichen | Kapitel | Pass./Kap. | Struktur erkannt aus |
|---|---|---|---|---|---|
| Esmâ-i Hüsnâ | 253 | 1280 | 10 | 25 | kolumnentitel |
| Hidayet Önderleri: Hz. Fatıma | 299 | 1294 | 11 | 27 | kolumnentitel |
| Hidayet Önderleri: Hz. Peygamber | 355 | 1244 | 116 | 3 | toc |
| Hidayet Önderleri: İmam Ali | 360 | 1261 | 112 | 3 | toc |
| Hidayet Önderleri: İmam Bakır | 303 | 1266 | 115 | 3 | toc |
| Hidayet Önderleri: İmam Cafer Sadık | 332 | 1261 | 101 | 3 | toc |
| Hidayet Önderleri: İmam Cevad | 318 | 1302 | 12 | 26 | kolumnentitel |
| Hidayet Önderleri: İmam Hadi | 323 | 1287 | 14 | 23 | kolumnentitel |
| Hidayet Önderleri: İmam Hasan | 311 | 1265 | 14 | 22 | kolumnentitel |
| Hidayet Önderleri: İmam Hasan Askerî | 334 | 1304 | 14 | 24 | kolumnentitel |
| Hidayet Önderleri: İmam Hüseyin | 324 | 1244 | 108 | 3 | toc |
| Hidayet Önderleri: İmam Mehdi | 318 | 1289 | 17 | 19 | kolumnentitel |
| Hidayet Önderleri: İmam Musa Kâzım | 305 | 1271 | 14 | 22 | kolumnentitel |
| Hidayet Önderleri: İmam Rıza | 329 | 1270 | 89 | 4 | toc |
| Hidayet Önderleri: İmam Seccad (Zeynelabidin) | 290 | 1230 | 79 | 4 | toc |
| Hz. Abbas | 159 | 1280 | 2 | 80 | kolumnentitel |
| Nehcü'l-Belâğa | 562 | 1246 | 170 | 3 | toc |
| Sahîfe-i Aleviyye | 255 | 1493 | 2 | 128 | kolumnentitel |
| Sahîfe-i Seccâdiye | 371 | 1314 | 38 | 10 | kolumnentitel |
Das ist der aussagekräftigste Wert der Tabelle, und er hängt fast vollständig daran, woher die Struktur kam. Bände mit einem eigenen Inhaltsverzeichnis im PDF (toc) kommen auf 3 Passagen je Kapitel – dort steht bei einem Treffer eine Kapitelangabe, mit der man etwas anfangen kann. Bände, deren Struktur nur aus den Kolumnentiteln gelesen werden konnte, kommen auf 20 bis 128: der Kolumnentitel nennt oft nur den Bandteil, nicht das Thema.
Warum das zählt: die Kapitelangabe ist nicht Zierrat. Sie geht als Herkunft in jede Zuordnung ein (analyzer.retrieve_belege) und steht später im Dokument neben dem Vers. Eine Passage, deren Kapitel „I“ heißt, ist zwar auffindbar, aber nicht belegbar – niemand kann nachschlagen, wo das steht.
Die gröbsten Fälle – hier ist die Kapitelangabe praktisch wertlos:
Das ist kein Datenverlust: der Passagentext selbst ist vollständig und wird richtig gefunden. Fehlerhaft ist nur die Fundstellenangabe. Reparieren ließe sich das über die fettgesetzten Zwischenüberschriften im Text, die ehlibeyt_rules.py heute nur als zweite Priorität nutzt.
6236 Ayets in 114 Suren. Die Vollständigkeit prüft audit_quran.py gegen die erwartete Ayet-Zahl je Sure – das ist die verlässlichere Prüfung als alles, was hier steht.
240 Ayets tragen eine Ehl-i-Beyt-Auslegung. Davon sind 201 auf dem wiedergefundenen Zitat verankert und 62 nur seitengenau. Der Unterschied steht in den Daten, weil die Fußnotenmarker im PDF unzuverlässig herauskommen – ein stiller Rateschritt wäre hier schlimmer als ein sichtbarer Vorbehalt.
735 Passagen aus 1 Band/Bänden, 33 Gestalten, 242 Unterkapitel – 3.0 Passagen je Kapitel. Das ist die feinste Struktur im ganzen Projekt, und zwar aus einem einzigen Grund: dieser Band trägt ein zweistufiges Inhaltsverzeichnis im PDF. Zum Vergleich reicht die Ehl-i-Beyt-Seite oben von 3 bis 128. Länge: Median 1285, längste 1999 Zeichen.
Jede Passage trägt ihre Gestalt und ihr Unterkapitel. Die Gestalt steht hier an der Passage und nicht am Band – anders als im Ehl-i-Beyt-Korpus, wo ein Band genau eine Gestalt behandelt. Das ist kein Formatunterschied, sondern der Grund, warum dieser Bestand ein eigenes Korpus ist.
| Gestalt | Passagen |
|---|---|
| MUSA VE HARUN ALEYHİSSELÂMLAR | 139 |
| İSA ALEYHİSSELÂM | 69 |
| ADEM ALEYHİSSELÂM | 60 |
| YUSUF ALEYHİSSELÂM | 46 |
| NUH ALEYHİSSELÂM | 41 |
| NÜBÜVVET, NEBÎ VE RESUL | 34 |
| DAVUD ALEYHİSSELÂM | 33 |
| SÜLEYMAN ALEYHİSSELÂM | 32 |
| IRMIYA ALEYHİSSELÂM | 31 |
| EYYUB ALEYHİSSELÂM | 27 |
Die zehn umfangreichsten von 33 Gestalten.
2947 Entitäten, 451 Aliase. 54 davon warten auf ein menschliches Urteil, 15 haben keinen Beleg in den Korpora – sie stammen aus dem Fachwissen in ontology_seed.py und behaupten damit etwas, das keine Quelle der Wissensbasis hergibt. Das ist zulässig, solange es sichtbar bleibt.
82 Alias-Kollisionen: ein Name zeigt auf mehrere Entitäten. Sie werden gemeldet und nicht aufgelöst – die Liste steht auf der Ontologie-Seite. Jede davon ist eine inhaltliche Entscheidung, keine technische.
131 Namen, 128 mit einem Kur'an-Beleg, der sich in quran.json auflösen lässt. Die übrigen 3 sind nicht stillschweigend korrigiert:
| Autorenschlüssel | Werke | analysiert | verschmolzen | Quelle |
|---|---|---|---|---|
| Kul Himmet | 17 | 2 | 0 | Alevilik-Kul-himmet.pdf |
| Nesimi | 8 | 0 | 1 | seyyid_nesimi.pdf |
| Pir Sultan Abdal | 84 | 3 | 0 | deyis.pdf |
| Pir Sultan Abdal (Antoloji) | 214 | 0 | 0 | pir_sultan_abdal_858_60417.pdf |
| Virani | 4 | 0 | 0 | Virani.pdf |
| Şah Hatayi | 195 | 2 | 4 | Hatayi_Divani.pdf |
„Verschmolzen" heißt: im Quellscan fehlt der Trenner zwischen zwei Gedichten, dieses eine Werk enthält also mehrere. Das ist sonst unsichtbar – das Werk ist bloß länger – und verschiebt alle folgenden Werk-IDs gegen die Nummerierung des Buches.