← Field Notes

Die NeurIPS-2026-Entscheidungen sind da. Laut Pangrams eigenem Bericht stufte die Version, die die Position Papers prüfte, bis zu 14,9% KI-polierter menschlicher Gutachten als „KI“ ein.

StrictCite Field Notes  ·  26. September 2026
English  ·  Deutsch  ·  日本語  ·  한국어
Jede Tatsachenbehauptung unten verlinkt auf eine Primärquelle: den Beitrag der Track Chairs, den NeurIPS Call for Papers, Pangrams eigenen technischen Bericht oder ein begutachtetes Paper bzw. Preprint. Wo wir keine Primärquelle fanden, sagen wir das, statt die Behauptung zu wiederholen.
Zusammenfassung

NeurIPS 2026 hat am 24. September die finalen Entscheidungen veröffentlicht[2]. Im Position Paper Track waren bereits im Juni 178 von 969 Einreichungen auf Grundlage von Pangram-KI-Erkennungswerten direkt abgelehnt worden[1], und rund um das Entscheidungsdatum kam eine neue Welle von Behauptungen: was in den Einspruchsverfahren geschah, wen der Detektor benachteiligte und warum. Wir haben zwölf der am häufigsten wiederholten Behauptungen an Primärquellen geprüft. Manche stimmen. Mehrere sind falsch oder unvollständig, darunter vier Aussagen in unserer eigenen Field Note vom 8. September[11], die wir inzwischen korrigiert haben. Zwei konnten wir gar nicht überprüfen. Außerdem haben wir zwei Primärdokumente gelesen, die die meisten Kommentare übergangen haben: Pangrams eigenen technischen Bericht vom Juli 2026[4], der v3.3.2, also genau die von NeurIPS genutzte Version, mit ihrem Nachfolger vergleicht, und ein ICML-2026-Paper von Saha et al.[5], das die NeurIPS-Ablehnungen namentlich behandelt. Keines stützt die lauteste Version der Kritik. Beide zeigen auf dasselbe, engere Problem: Text, den ein Mensch geschrieben und eine KI danach poliert hat — genau das, was die Regeln des Tracks erlauben.

1. Was sich am 24. September geändert hat und was nicht

Der Call for Papers des Position Paper Tracks nennt den 24. September als Datum der finalen Entscheidungen[2]. An diesem Tag erfuhren die verbliebenen Einreichungen, ob sie angenommen wurden. Es ist nicht die Frist für die 123 bedingt markierten Papiere. Deren Autoren hatten bis zum 15. Juni Zeit, ein Dossier mit Versionsverlauf vorzulegen, sonst folgte die Desk Rejection[1].

Unverändert ist die öffentliche Faktenlage. Stand 26. September betreffen die neuesten Beiträge im NeurIPS-Blog Affinity-Events (25. September) und finanzielle Unterstützung (16. September)[3]. Der Beitrag der Chairs vom 2. Juni hat keinen Nachtrag. Nirgends ist öffentlich, wie viele der 123 Dossiers anerkannt wurden, wie viele Autoren zurückzogen oder wie viele Position Papers der Track am Ende annahm. Jede Zahl, die du dazu siehst, stammt nicht von NeurIPS, und wir haben keine mit Quelle gefunden.

Abbildung 1. So sortierten die Chairs 969 Position Papers
Abbildung 1. So sortierten die Chairs 969 Position Papers  ·  Herunterladen: PNG · SVG

2. Zwölf Behauptungen, geprüft

Das sind die Behauptungen, die wir rund um das Entscheidungsdatum in Beiträgen und Zusammenfassungen am häufigsten gesehen haben, auch in unserem eigenen früheren Text. Jedes Urteil beruht auf der Quelle, die in derselben Zeile verlinkt ist.

Behauptung Was die Primärquelle sagt Urteil
Der 24. Sept. war das finale Ablehnungsdatum für die 123 bedingten Papiere. Die Nachweisfrist war der 15. Juni[1]. Der 24. Sept. ist das Datum der finalen Entscheidungen für den ganzen Track[2]. Falsch
Einsprüche scheiterten, wenn große Textblöcke in einzelnen Commits auftauchten oder Autoren Grammarly bzw. DeepL angaben. Keine Quelle gefunden. Dossiers werden „vom PPT-Team geprüft“[1], Ergebnisse sind nicht öffentlich. Unabhängig davon ergab ein kontrollierter Test für Grammarly-Korrekturen 0 von 100 „KI“-Urteilen von Pangram[5]. Nicht überprüft
79 Papiere wurden wegen Wert über 0,8 und Alleinautorschaft abgelehnt. Das Kriterium ist Wert ≥0,8 plus entweder ein Autor, der „mehrere Papiere in Alleinautorschaft eingereicht hat, mindestens eines über der Schwelle“, oder ein Autor mit „mindestens einer weiteren Desk Rejection“[1]. Alleinautorschaft allein löst es nicht aus. Falsch (haben wir auch geschrieben)
22 Papiere wurden abgelehnt, weil sie über 0,5 lagen, nachdem der Autor jede KI-Nutzung verneint hatte. Das Kriterium ist Wert ≥0,5, wenn der „Autor erklärte, keine KI genutzt zu haben, oder keine KI-Nutzung angab“[1]. Es erfasst auch Autoren, die die Erklärung leer ließen. Unvollständig (haben wir auch geschrieben)
Gegen die 178 Desk Rejections gab es keinen Einspruch. „Eine normale Desk Rejection, die unter normalen Umständen nicht anfechtbar ist“[1]. Die 123 sind als „Desk Reject with Appeal“ geführt. Stimmt, mit Einschränkung
Bei Standardfenstern von 250–350 Wörtern erreichten 42,7% der Einreichungen 90–100% KI. Tabelle 1 und 3 im Beitrag der Chairs: 42,7% ≥90%, 28,2% bei 100%, 70,5% ≥50%[1]. Stimmt
Die Chairs verkleinerten die Fenster auf 100 Wörter, um die Quote zu drücken. Die Zahlen stimmen: 42,7% fielen auf 12,7% bei ≥90%. Das Motiv ist nicht das, das die Chairs nannten. Sie sagten, kleinere Fenster verringerten das „Überschätzen der KI-Nutzung“, und veröffentlichten den damit verbundenen Verlust an Recall (Tabelle 2)[1]. Zahlen stimmen, Deutung nicht
Unabhängige Forscher ließen die Papiere der Chairs durch Pangram laufen und erhielten 24%, 36%, 45% und 69%. Eine Person: Sergey Berezin, in einem LinkedIn-Beitrag vom 3. Juni. Er nannte die vier Papiere und schrieb: „Ich behaupte ausdrücklich nichts über den Entstehungsprozess dieser Papiere“[6]. Sein Beitrag sagt nicht, dass sein eigenes Papier abgelehnt wurde. Stimmt, eine Quelle (wir haben seinen Status übertrieben)
Pangram benachteiligt Nicht-Muttersprachler. Stanford fand 61,22% Fehlalarme bei TOEFL-Aufsätzen. Die 61,22% stammen von Liang et al. (2023), die sieben andere Detektoren testeten[7], nicht Pangram. Auf denselben TOEFL-Aufsätzen meldet Pangrams eigener Bericht für v3.3.2 0 Falsch-Positive von 89[4]. Das sind Herstellerdaten, nicht unabhängig repliziert. Falsch in Bezug auf Pangram
In einem anderen NeurIPS-Track stieg die KI-Nutzung um mehr als das Zehnfache. In Evaluations & Datasets stieg der Anteil der Papiere mit ≥90% von 0,8% (2025) auf 9,3% (2026)[1]. Stimmt
Substack führte Pangram für zahlende Abonnenten ein und prägte „Claudefishing“. Chris Best prägte den Begriff am 21. Juli. Der Scan läuft bei Texten über 100 Wörter und „zeigt eine Analyse nur denen, die sie anfordern“[8]. Bests Beitrag beschränkt ihn nicht auf zahlende Abonnenten. Teilweise falsch
Die Community mobilisierte den ganzen September über in riesigen Reddit-Threads. Wir fanden keinen konkreten Thread, den wir zitieren könnten, und wiederholen es daher nicht. Nicht überprüft
Abbildung 2. Allein die Fenstergröße senkte den Anteil ≥ 90% von 42,7% auf 12,7%
Abbildung 2. Allein die Fenstergröße senkte den Anteil ≥ 90% von 42,7% auf 12,7%  ·  Herunterladen: PNG · SVG

3. Was wir am 8. September falsch hatten

Unsere frühere Field Note[11] enthielt vier Fehler. Wir haben die Seite heute korrigiert und als aktualisiert markiert. Wir führen sie hier auf, weil dieser Text anderen dieselben Fehler vorhält:

  • Wir schrieben, die 79er-Stufe sei „Wert über 0,8 + Alleinautorschaft“. Das tatsächliche Kriterium steht in der Tabelle oben.
  • Wir schrieben, die 22er-Stufe setze eine ausdrückliche Verneinung von KI-Nutzung voraus. Sie erfasst auch Autoren ohne Erklärung.
  • Wir nannten Sergey Berezin „einen abgelehnten Autor“. Sein Beitrag sagt das nicht.
  • Wir schrieben Gutachterbeschwerden über „Claude-Sprech“ seinem Beitrag zu. Wir finden die Formulierung in der zitierten Quelle nicht und haben sie entfernt.

4. Was Pangrams eigener Bericht über die von NeurIPS genutzte Version sagt

Die Chairs prüften den Track mit Pangram v3.3.2[1]. Am 29. Juli veröffentlichte Pangram Labs den technischen Bericht zu v4 auf arXiv[4], und fast jede Tabelle darin vergleicht v4 mit 3.3.2. Soweit wir wissen, ist das der einzige veröffentlichte Benchmark des Modells, das den Track geprüft hat. Es sind Herstellerdaten, gemessen auf vom Hersteller gewählten oder selbst ausgeführten Benchmarks, nicht auf Position Papers. Mit dieser Einschränkung lauten die Zahlen:

Maß (Pangrams eigener Bericht) v3.3.2 v4 Stelle
Falsch-Positive, über 1 Mio. menschlich verfasster englischer Texte0,0539%0,0041%§5.3
Falsch-Negative, 520.000 KI-Texte1,99%0,34%§5.2
Falsch-Positive, 24.586 Texte von Englischlernenden2 (0,0081%)1 (0,0041%)Tabelle 9
… davon TOEFL-Aufsätze von Liang et al. (n=89)00Tabelle 9
KI-polierter Text als „KI“ eingestuft (n=11.363)0,18%0,01%Tabelle 4
KI-polierte menschliche Gutachten als „KI“ eingestuft, leichte / schwere Teilmenge14,9% / 4,5%1,4% / 2,5%Tabelle 28
Stark KI-bearbeiteter Text korrekt als „Mixed“ eingestuft (n=14.990)5,54%55,01%Tabelle 5
Mittlerer Fehler beim geschätzten KI-Anteil, gemischte Dokumente28,6 Pkt.5,9 Pkt.Tabelle 7

Wir lesen daraus drei Dinge, und das erste widerspricht der Kritik, über die wir früher berichtet haben.

Rein menschlicher Text ist nicht das Risiko. Bei der für v3.3.2 berichteten Falsch-Positiv-Rate von 0,0539% wären über 969 Papiere etwa 0,5 Fehlalarme zu erwarten, wenn sich Position Papers wie die Testdaten des Herstellers verhalten. Das hat niemand gezeigt. Aber wenn die Zahl auch nur ungefähr stimmt, können Fehlalarme bei vollständig menschlich geschriebenen Papieren keine Ablehnungsquote von 18,4% erklären. Die Erklärung muss mit KI zu tun haben: entweder KI-Entwürfe oder das KI-Polieren, das die Regeln erlauben.

Die ESL-Behauptung, wie sie meist formuliert wird, passt nicht zu Pangrams Daten. Auf genau den TOEFL-Aufsätzen, die bei anderen Detektoren die viel zitierten 61,22% ergaben, hatte v3.3.2 null Fehlalarme. Der Bericht zeigt allerdings, dass der Hersteller diese Fälle als die schwierigen behandelt. Bei der Beschreibung eines verworfenen Trainingsdesigns heißt es, die Fehler hätten sich „in bestimmten Registern konzentriert: akademisches Schreiben und ESL-Aufsätze“[4]. Einen unabhängigen Test von v3.3.2 an akademischen Texten nicht-muttersprachlicher Autoren haben wir nicht gefunden.

Bei poliertem menschlichem Text war v3.3.2 am schwächsten. Bei menschlich verfassten Gutachten, die anschließend von einer KI poliert wurden, stufte v3.3.2 14,9% der leichten Teilmenge als vollständig „KI“ ein. Das ist das Zehnfache von v4 auf derselben Teilmenge. Die Zeile, die der Bericht mit Pangram 3.0 beschriftet, zeigt 3,0%; die von NeurIPS genutzte Version schnitt hier also schlechter ab als Vorgänger und Nachfolger. Der Bericht nennt das Verhalten von 3.3.2 bei gemischtem Text außerdem „polarisiert“: KI-unterstützte Texte werden lieber als Human oder KI statt als Mixed eingestuft. Genau diese Kategorie erlauben die Regeln des Tracks ausdrücklich („Lektorat oder ähnliche periphere Änderungen“[1]). Die Chairs haben das getestet: Bei 100-Wort-Auszügen aus 10 FAccT-2022-Papieren wurde keine der erlaubten Bearbeitungen markiert, die sie ausprobierten[1]. Zehn Stichproben sind ein kleiner Test neben der Herstellerzahl aus einem größeren Benchmark.

Abbildung 3. Pangram 3.3.2 nannte bis zu 14,9% KI-polierter Gutachten „KI“
Abbildung 3. Pangram 3.3.2 nannte bis zu 14,9% KI-polierter Gutachten „KI“  ·  Herunterladen: PNG · SVG
Abbildung 4. Die „61% Fehlalarme bei ESL“ wurden nicht an Pangram gemessen
Abbildung 4. Die „61% Fehlalarme bei ESL“ wurden nicht an Pangram gemessen  ·  Herunterladen: PNG · SVG

5. Das ICML-Paper, das die Ablehnungen namentlich behandelt

Das Paper Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable von Saha, Juneja, Chaudhuri, Sajeevan, Shah und Pruthi erscheint auf der ICML 2026[5]. Es ist die sorgfältigste Quelle, die wir gefunden haben, und sein Fazit ist differenzierter als beide Seiten des Streits. Der Hauptbefund: Alle fünf getesteten Detektoren „stufen einen nicht unerheblichen Anteil LLM-polierter Gutachten fälschlich als KI-generiert ein“. Pangram stufte 3,1% der KI-polierten menschlichen Gutachten als „KI“ ein, nicht einmal als „Mixed“. Im Anhang:

  • Grammarly: Nachdem bei 100 menschlichen Gutachten jede Grammarly-Korrektur angenommen wurde, lieferte Pangram 89-mal „Human“, 11-mal „Mixed“ und 0-mal „KI“.
  • Maschinelle Übersetzung: Nach einem Hin- und Rückweg über Deutsch, Chinesisch oder Japanisch mit Google Translate und DeepL stufte Pangram 1,1% bis 4,5% der Gutachten als vollständig „KI“ ein, je nach Sprache und Reihenfolge der Übersetzer.
  • Polieren mit Stilvorgaben („britisches Englisch“, „kurze Sätze“): 2,42% als „KI“ eingestuft.

Das Übersetzungsergebnis ist wichtig für alle, die in einer anderen Sprache entwerfen. Die Regeltabelle der Chairs stuft „Übersetzung / Rückübersetzung“ als grenzwertig zulässig ein[1].

Zu NeurIPS stellen die Autoren klar, dass ihre Zahlen nicht beweisen, dass die Ablehnungen falsch waren:

„Unsere Falsch-Positiv-Rate von ca. 3% bei KI-polierten (H-AI) Gutachten ist am besten als Rate pro Fenster zu verstehen, nicht pro Papier … Wären die Falsch-Positiv-Raten der Fenster unabhängig, wäre es unwahrscheinlich, dass bei einem nur mit LLMs polierten Papier mehr als 50% der Fenster markiert werden … Eine zentrale Einschränkung ist jedoch, dass diese Überlegung Unabhängigkeit zwischen Fenstern desselben Papiers voraussetzt. Der individuelle Schreibstil eines Autors kann korrelierte Fehler über Fenster hinweg erzeugen … Falsch-Positiv-Raten pro Fenster sollten daher in keine Richtung auf ganze Papiere hochgerechnet werden.“[5]

Wir haben das Argument mit der schlechteren Rate von v3.3.2 nachgerechnet. Würde jedes Fenster eines nur polierten Papiers unabhängig mit 14,9% markiert, läge die Wahrscheinlichkeit, dass mehr als die Hälfte eines Papiers mit 30 Fenstern markiert wird, bei etwa eins zu einer Million. Alles hängt an der Unabhängigkeitsannahme. Sie besagt, dass der Stil eines Autors von Absatz zu Absatz keine Rolle spielt, obwohl gerade ein beständiger Stil einen Text wiedererkennbar macht. Niemand hat das gemessen. Am stärksten betroffen ist die 22er-Stufe, deren Schwelle bei 0,5 statt 0,8 oder 0,9 liegt.

6. Zwei Dinge im Beitrag der Chairs, die wir nicht in Einklang bringen konnten

Welche Fenstereinstellung über die Ablehnungen entschied. Laut Tabelle 3 im Beitrag der Chairs erreichten mit mittleren Fenstern 12,7% der Papiere (etwa 123) ≥90%, mit Standardfenstern 42,7% (etwa 414). Tabelle 5, die Entscheidungstabelle, lehnt bei ≥0,9 ohne weitere Bedingung 77 Papiere ab[1]. Auf den ersten Blick passt 77 zu keiner der beiden Zahlen, und der Beitrag sagt nicht, welche Werte Tabelle 5 verwendete. Vielleicht gibt es eine einfache Erklärung, etwa eine andere Wertdefinition oder spätere Ausschlüsse, aber sie steht nicht im Beitrag. Autoren können eine Schwelle nicht nachprüfen, wenn sie nicht wissen, auf welchen Wert sie angewendet wurde.

Die Gutachterseite. Dieselben Regeln verlangten von Gutachtern, „sich zu verpflichten, keine KI-Tools zum Schreiben ihrer Gutachten zu nutzen“[1]. Der Beitrag beschreibt die Prüfung jeder Einreichung, aber keine Prüfung der Gutachten. Zur Einordnung, wie gut eine Verpflichtung ohne Durchsetzung hält: In einem randomisierten Experiment auf der ICML 2026 gaben 22,5% der Gutachter mit LLM-Verbot in einer Umfrage an, trotzdem ein LLM genutzt zu haben[9]. Das ist eine andere Konferenz und sagt nichts direkt über NeurIPS-Gutachter. Es zeigt aber, dass die Erklärung, die die Chairs bei Autoren für unzureichend hielten, bei Gutachtern die Grundlage bleibt.

7. Was noch nicht öffentlich ist

  • Wie viele der 123 bedingten Papiere ein Dossier einreichten, wie viele anerkannt wurden und wie viele zurückgezogen wurden.
  • Wie viele Position Papers der Track am 24. September angenommen hat.
  • Welche Fenstereinstellung und Wertdefinition die Schwellen in Tabelle 5 verwendeten.
  • Ob abgelehnte Autoren ihre eigenen Werte und die Fenstereinteilung ihres Textes zu sehen bekamen.
  • Eine Kalibrierung von v3.3.2 an formaler akademischer Prosa nicht-muttersprachlicher Autoren, von Pangram oder sonst jemandem.

Wir aktualisieren diese Seite, falls die Chairs etwas davon veröffentlichen. Wenn du betroffen bist und Primärunterlagen teilen möchtest, etwa den Wortlaut der Benachrichtigung oder ein Dossier-Ergebnis, erreichst du uns unter [email protected]. Wir veröffentlichen nichts, was wir nicht überprüfen können.

8. Wenn du betroffen bist oder im nächsten Zyklus einreichst

Die Ablehnung wird als normale Desk Rejection beschrieben. Der Beitrag der Chairs verwendet die Formulierung „a standard desk-rejection“[1] und beschreibt sie nicht als Feststellung von Fehlverhalten. Sobald das Papier bei NeurIPS nicht mehr begutachtet wird, gelten die üblichen Regeln für eine Einreichung anderswo. Prüfe die Regeln der neuen Konferenz zu Doppeleinreichungen und KI-Nutzung.

Erkläre konkret. Die 22er-Stufe umfasste Autoren, die keine KI-Nutzung erklärten, und Autoren, die gar nichts erklärten. Eine leere Erklärung wurde wie eine Verneinung behandelt.

Führe einen Versionsverlauf. Das Dossier, das die Chairs verlangten, bestand aus einem Checkpoint vor der KI-Nutzung, einem danach, dem finalen Papier und einer Analyse, dass die KI-Bearbeitungen keine neue Substanz hinzugefügt haben[1]. Sie schrieben: „Wir erwarten, dass diese Art von Prüfpfad in künftigen Jahren zum Standard wird.“ Overleaf-Verlauf, Git-Commits oder der Versionsverlauf von Google Docs erzeugen ihn nebenbei. Im Nachhinein ist er kaum zu rekonstruieren.

Kenne die Belege zu deinen Werkzeugen. Im einzigen kontrollierten Test, den wir gefunden haben, führte eine vollständige Grammarly-Korrektur zu keinem „KI“-Urteil von Pangram. Maschinelle Übersetzung eines ganzen Gutachtens führte in 1,1–4,5% der Fälle dazu[5]. Beides sind kleine Tests an Texten von Gutachtenlänge, nicht an Papieren.

Achte auf Alternativen zu Detektoren. Ein Vorschlag, greCAPTCHA (Payan, Gyevnár, Kasirzadeh & Shah, 17. September), prüft, ob die genannten Autoren ihr eigenes Papier verstehen, statt die Prosa zu bewerten. Der Prototyp erreichte mit 31 Forschenden eine AUC von 0,90 bei der Vorhersage tatsächlicher Autorschaft[10]. Es ist ein kleiner Prototyp, und uns ist keine Konferenz bekannt, die ihn einsetzt.

9. Was Zitationsprüfung leisten kann und was nicht

StrictCite erkennt keine KI-Prosa, und nichts auf dieser Seite ist ein Argument für unser Produkt statt Pangram. Die beiden beantworten verschiedene Fragen. Pangram schätzt, wer einen Satz geschrieben hat, und wie die Abschnitte 4 und 5 zeigen, verorten selbst die Benchmarks des Herstellers die Unsicherheit in der polierten Mitte. Eine Referenz führt entweder zu einem echten Eintrag in Crossref, OpenAlex oder DBLP oder nicht, und die Antwort kannst du selbst prüfen. Das ist der andere Desk-Rejection-Mechanismus der NeurIPS in diesem Zyklus[12], und er ist der, den du vor der Einreichung vollständig selbst prüfen kannst. Prüfe eine Bibliografie kostenlos auf strictcite.com.

References

  1. [1] Lu, A., Lazar, S., & Rügamer, D. (NeurIPS Position Paper Chairs), with Hua, S. & Metcalf, K. AI-Generated Papers in the NeurIPS 2026 Position Paper Track. NeurIPS Blog, 2 June 2026. Tables 1–5 and the appeals section. blog.neurips.cc/2026/06/02/ai-generated-papers-in-the-neurips-2026-position-paper-track ↑
  2. [2] NeurIPS 2026 Call for Position Papers: dates (final decisions 24 September) and AI-use policy. neurips.cc/Conferences/2026/CallForPositionPapers ↑
  3. [3] NeurIPS Blog, 2026 Conference category (post index, checked 26 September 2026). blog.neurips.cc/category/2026-conference ↑
  4. [4] Glickenhaus, B., Thai, K., Russell, J., Masrour, E., Han, Y., Spero, M., & Emi, B. (2026). Pangram 4 Technical Report. arXiv:2607.27183, 29 July 2026. §4.1, §5.2–5.3, Tables 4, 5, 7, 9, 28. arxiv.org/abs/2607.27183 ↑
  5. [5] Saha, R., Juneja, G., Chaudhuri, D., Sajeevan, N., Shah, N. B., & Pruthi, D. (2026). Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable. ICML 2026. arXiv:2603.20450v2. §1 (“AI detection on full papers and a note on NeurIPS PPT desk rejections”), Appendix B. arxiv.org/abs/2603.20450 ↑
  6. [6] Berezin, S. (2026). We Shouldn’t Desk-Reject Papers Based on Unvalidated AI Detection. LinkedIn, 3 June 2026. linkedin.com/pulse/we-shouldnt-desk-reject…-orc6e ↑
  7. [7] Liang, W., Yuksekgonul, M., Mao, Y., Wu, E., & Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7), 100779. doi.org/10.1016/j.patter.2023.100779 ↑
  8. [8] Best, C. (2026). Against Claudefishing. The Substack Post, 21 July 2026. post.substack.com/p/against-claudefishing ↑
  9. [9] Kim, S. S. Y., Deng, W. H., Vaughan, J. W., Su, B., Su, W., Agarwal, A., Li, S., Jaggi, M., Goldstein, D. G., Shah, N. B., & Dudík, M. (2026). Use and Effects of LLMs in Peer Review: A Randomized Experiment and Survey at ICML 2026. arXiv:2609.19420. arxiv.org/abs/2609.19420 ↑
  10. [10] Payan, J., Gyevnár, B., Kasirzadeh, A., & Shah, N. B. (2026). greCAPTCHA: Assessing Understanding as Evidence of Research Authorship Under Generative AI. arXiv:2609.20481. arxiv.org/abs/2609.20481 ↑
  11. [11] StrictCite Field Notes. NeurIPS Desk-Rejected 178 Position Papers for Being “AI-Generated.” The Detector Flagged the Track Chairs Too. 8 September 2026, corrected 26 September 2026. strictcite.com/blog/neurips-2026-position-paper-pangram-ai-detection-de ↑
  12. [12] StrictCite Field Notes. NeurIPS Started Desk-Rejecting Papers Over References That Don’t Exist. strictcite.com/blog/neurips-2026-hallucinated-citations-desk-reject ↑