1. Вопрос, на который не отвечает ни одна рекламная страница
Спросите любой сервис проверки цитирований, что он делает, и ответ всегда будет вариацией одной и той же фразы: разрешается ли этот DOI, совпадает ли этот заголовок с записью в реестре, существует ли эта статья на самом деле. Это реальный, полезный вопрос — но не тот, который нужен для обнаружения вымышленного соавтора. ИИ-инструменту, создающему ссылку, редко приходится выдумывать целиком поддельную статью — Attention Is All You Need реальна, знаменита и её легко воспроизвести приблизительно верно. Что проходит незамеченным — это имя, добавленное к настоящему списку авторов настоящей статьи с настоящим DOI. Любая проверка, построенная вокруг вопроса «существует ли эта статья», пропускает это, потому что сама статья никогда не была проблемой.
Мы построили собственный бесплатный инструмент именно вокруг этого пробела[1] — после того как проверили, реален ли он. Это и есть тот тест, полностью, включая те места, где наш собственный движок дал сбой.
2. Что мы на самом деле тестировали
За основу взята настоящая, неизменённая запись BibTeX, которую сам NeurIPS публикует для Attention Is All You Need[2]. На её основе мы построили шесть вариантов, каждый — с одним изолированным изменением, чтобы обнаружение сервисом было доказательством обнаружения именно этой конкретной вещи:
- Вымышленный девятый соавтор, добавленный к настоящим восьми.
- Вымышленный DOI (подтверждённо не разрешающийся), присоединённый к настоящему заголовку и авторам.
- Полностью выдуманная статья, проверенная перед использованием по Crossref, OpenAlex и веб-поиску на предмет совпадения с чем-либо реальным.
- Настоящий DOI с изменённым годом — с 2017 на 2015.
- Настоящая, знаменитая ретракция — Wakefield et al., 1998, The Lancet[3] — процитированная просто, без единого указания на то, что она была когда-либо отозвана.
- Химера: настоящий заголовок Attention Is All You Need с подставленными настоящими авторами BERT (Devlin, Chang, Lee, Toutanova).
Все шесть были прогнаны через CiteTrue, Citely, CiteMe, aicitationchecker.org и Sourcely — каждый протестированный сервис был выбран за по-настоящему бесплатный вход без регистрации. Полнота покрытия оказалась неодинаковой для всех пяти, и мы сообщаем об этом честно, а не сглаживаем: собственный интерфейс CiteTrue ни разу не выдал результат по случаю 6 в этом прогоне; логика дедупликации пакетов CiteMe схлопнула четыре из шести вариантов с заголовком «Attention is all you need» в одно неоднозначное сравнение, оставив чистые, индивидуально приписываемые результаты только для случаев 3 и 5; а собственный валидатор ввода aicitationchecker.org полностью отклонил случай 3 ещё до того, как его вообще можно было проверить — сама по себе находка, разобранная в разделе 4.
3. Результаты по шести случаям
Ещё раз о случае 5: два из трёх сервисов в этой таблице сопоставили ссылку с записью в базе данных, заголовок которой буквально начинается со слова «RETRACTED», и вернули простой, безоговорочный положительный результат. Это не отсутствующий сигнал — это видимый сигнал, проигнорированный. Это более серьёзный сбой, чем в случае 1, потому что доказательство того, что что-то не так, уже было на экране.
CiteMe, протестированный отдельно на тех же шести случаях, корректно отклонил полностью выдуманную статью («No matching record found», проверено по шести реестрам) и присвоил ретракции собственную высокоприоритетную категорию — оба этих момента честно засчитываются в его пользу. Но три из шести вариантов «Attention is all you need» схлопнулись в его пакетном отчёте в одно дедуплицированное сравнение, и это объединённое сравнение выявило кое-что достойное отдельного упоминания: «исходная запись», с которой оно было сопоставлено, несла DOI 10.65215/2q58a426 и год публикации 2025 — точную сигнатуру схемы цитатного спама, которую мы задокументировали в предыдущей заметке[4]: пять дублирующих записей Crossref для этой же статьи под поддельной датой 2025 года. Собственное «исправленное» предложение CiteMe для этой ссылки звучало как «Attention Is All You Need (2025)» — взятое из поддельной записи, а не из настоящей. Нажатие «Use corrected» здесь сделало бы библиографию неверной, а не верной.
4. Сервис, который не смог даже прочитать ссылку
Валидатор ввода aicitationchecker.org полностью отклонил наш случай с выдуманной статьёй: «Multiple publication years (3: 2019, 2019, 2019). If these are separate references, place each on its own line.» Ссылка представляет собой единственную, нормально оформленную запись на площадку, чьё собственное название случайно содержит год ещё дважды — «Proceedings of the 2019 International Workshop on Efficient Deep Learning (WEDL 2019)» — совершенно обычная модель для ежегодно именуемой конференции или семинара. Похоже, что валидатор считает похожие на год подстроки в строке и при трёх и более предполагает, что это несколько склеенных ссылок, без какой-либо модели того, что название площадки регулярно повторяет свой год. Это само по себе достойно упоминания: сервис проверки цитирований, который не может даже принять на вход нормально оформленную ссылку на ежегодно именуемую площадку, прежде чем вообще дойти до проверки.
5. Sourcely показал лучший результат. Поэтому мы усложнили задачу.
Sourcely корректно распознал пять случаев из шести, с точным, конкретным обоснованием — «Jacob Devlin et al. are the authors of BERT, not ‘Attention Is All You Need,’ which was authored by Ashish Vaswani and colleagues» — это не сравнение полей, это похоже на настоящее рассуждение. Это подняло очевидный вопрос: проверяет ли он живой реестр или воспроизводит одну из наиболее часто встречающихся в обучающих данных любой языковой модели статей? У Attention Is All You Need свыше 267 000 цитирований. Правильный список авторов сам по себе не доказывает, что сервис проверяет, а не вспоминает.
Поэтому мы повторили три самых острых теста на настоящей статье, опубликованной за пять недель до написания этого текста — Leak It: Per-Document Extraction Beyond Aggregate Membership Inference, arXiv:2608.00144, препринт с единственным автором Виктором Марикато, подтверждённый вживую[5] — исходя из того, что практически ничто не могло её запомнить. Sourcely корректно и без подсказок определил настоящего единственного автора как против добавленного вымышленного соавтора, так и против полной замены авторов — на статье без сколько-нибудь заметного присутствия там, где обучающие данные модели могли бы её увидеть. Это настоящее доказательство живой, опирающейся на реестры проверки, а не воспроизведения по памяти, и это самый честный, самый сильный результат, который какой-либо сервис показал во всём этом тесте.
У него также есть реальное, воспроизводимое слепое пятно, и чтобы его найти, потребовалось построить более сложный случай, а не довольствоваться первым результатом. DOI, который реален, разрешается и указывает на совершенно другую, настоящую статью — не опечатка, не заглушка, а действующий, работающий перехват — дважды, по отдельности, был назван «Real» вообще без предупреждения. Собственный текст пояснения Sourcely в обоих случаях верно указывал, что DOI неверен («incorrectly points to…»); но категория вердикта всё равно оставалась «Real». Дополнительный раунд из десяти новых целевых пограничных случаев показал реальную форму этой проблемы: изолированные библиографические огрехи в остальном опознанной записи — неверный диапазон страниц, выдуманный номер выпуска, переставленный порядок авторов, DOI, явно являющийся опечаткой на один символ от верного — корректно и разумно попадают в промежуточную категорию «Uncertain», а не в ложную «Fake». Это разумная калибровка, а не недостаток. Но изолированный DOI, перехваченный в пользу совершенно другой настоящей статьи, без каких-либо иных проблем, всё равно был пропущен как чистый «Real» — самое вводящее в заблуждение, что может сделать ссылка, потому что ссылка разрешается и выглядит заслуживающей доверия именно потому, что она настоящая — просто настоящая для чего-то другого.
6. Мы прогнали те же двадцать два теста против самих себя
Что-либо меньшее превратило бы остальную часть этого текста в рекламный документ вместо полевой заметки. Мы взяли полный набор — исходные шесть, три повтора на малоизвестной статье, ещё три их варианта и десять случаев из дополнительного раунда — и прогнали все двадцать два через собственный движок StrictCite, тот же конвейер, что использует рабочее пространство, без офлайн-сокращений и с каждым реестром вживую.
Результат, которым мы гордимся больше всего: тот самый случай перехвата DOI, который Sourcely, сильнейший участник во всём этом тесте, дважды назвал «Real». StrictCite проследовал по DOI, выяснил, на что он на самом деле указывает, и вернул полное, подкреплённое источниками сравнение полей:
authors: manuscript «Maricato, V.» — datacite/openalex both say «Ruiz, Marco; Arana-Catania, Miguel; Ardila, David R.; Ventura, Rodrigo»
VERDICT: CONFLICT
Не «DOI выглядит подозрительно» — а настоящий заголовок и настоящие авторы, стоящие за этим DOI, положенные рядом с тем, что было процитировано, расходящиеся и в том, и в другом. Настоящая, знаменитая ретракция получила самую ясную обработку среди всех протестированных сервисов, включая наш — в каждой другой строке этого сравнения: вердикт INTEGRITY, самая серьёзная категория, какая есть у движка, с прямой цитатой отозванного заголовка из каждого источника. Вымышленный соавтор и у знаменитой, и у малоизвестной статьи породил чистый конфликт на уровне поля, называющий все три независимых источника, расходящихся с рукописью, — вместо тихого пропуска или тихой перезаписи.
Он также нашёл две ошибки в нашем собственном продукте, и мы называем обе, а не только сообщаем о чужих:
- Случай химеры с авторами BERT, запущенный без DOI или arXiv-идентификатора в ссылке — только нечёткое сопоставление заголовка и авторов — свёлся к UNVERIFIED вместо чистого CONFLICT: ни один кандидат не достиг порога совпадения, и настоящая статья даже не появилась среди показанных близких промахов. Тот же самый сценарий с неверными авторами на малоизвестной статье, где arXiv-идентификатор присутствовал в ссылке, разрешился корректно и чисто. Полная замена авторов не должна быть для движка сложнее объяснить, чем одно добавленное имя — если уж на то пошло, это более серьёзный случай — и сейчас это именно так, особенно когда ссылка не даёт нам идентификатора для привязки поиска.
- В случаях с выдуманным журналом структурированные данные полей корректно показывают, что поле контейнера/площадки вообще не было извлечено из ссылки — тем не менее отдельное сообщение всё равно срабатывало, утверждая, что выдуманное название журнала и «arXiv (Cornell University)» являются «abbreviation variants of the same publication». Это не так, и то, что две части нашего собственного результата противоречат друг другу, хуже, чем если бы ошибалась только одна из них. Это похоже на пробел в разборе: название площадки, стоящее между заголовком и необработанным DOI/URL — именно в той форме, которую фактически принимает ссылка с выдуманным журналом — не распознаётся как поле контейнера.
Ни одна из двух ошибок ни разу не изменила вердикт с безопасного на небезопасный — движок ни в одном из случаев уверенно не подтвердил фальсификацию, а это и есть свойство, которое действительно имеет значение — но обе сделали показанные доказательства менее ясными, чем следовало бы, а «менее ясно, чем следовало бы» — это ровно тот стандарт, по которому весь этот текст судит пять других компаний. Поэтому мы их исправили и сообщаем ровно о том, насколько далеко на самом деле простирается каждое исправление, не округляя в свою пользу.
Пробел в разборе журнала закрыт. Первопричина: поле контейнера у текстовой ссылки не имело правила останавливаться на следующем за ним URL, поэтому выдуманное название журнала, приклеенное к собственной ссылке DOI статьи — «Nature Machine Intelligence. https://doi.org/10.48550/arXiv.2608.00144» — разбиралось как единый блок текста, и буквальная подстрока «arxiv» внутри этого URL срабатывала как фильтр, предназначенный для распознавания настоящих ссылок на репозитории — отбрасывая выдуманный журнал, будто его не было вовсе. Теперь URL останавливает извлечение контейнера точно так же, как это уже делали том или год. Повторный прогон по всем трём затронутым случаям: каждый теперь корректно сообщает журнал как неподтверждённый, с точным сообщением вместо ложного.
Пробел с химерой закрыт наполовину, и мы называем оставшуюся половину, а не позволяем исправлению выдавать себя за неё. Собственно ошибка — защитное правило, построенное для того, чтобы рецензия на книгу не могла подставить метаданные настоящего учебника, блокировала также и точное совпадение заголовка, а не только похожее, не давая ему вообще дойти до кандидата, с которым нужно было сравнить неверное поле авторов — исправлена и подтверждена: полная замена авторов без имеющегося идентификатора теперь чисто, с указанием источников, разрешается в CONFLICT, подтверждено от начала до конца на настоящей статье с уникальным заголовком. Она пока не устраняет конкретный случай из этого текста. Оказывается, «Attention is all you need» — это ещё и точный заголовок других, не связанных настоящих работ на OpenAlex и Zenodo, и канонический документ Васвани не всегда попадает в пятёрку результатов, которые наш собственный поиск по заголовку получает по каждому источнику для настолько общей фразы. Это отдельное, более глубокое ограничение поиска, а не та ошибка скоринга, которую мы нашли и исправили, и мы не патчим его в ответ на один наихудший заголовок, не взвесив компромисс как следует.
7. В пользу чего это на самом деле аргумент
Не в пользу того, что проверка на основе ИИ в принципе проваливается на лёгких случаях — результат Sourcely на малоизвестной, пятинедельной статье реален, и утверждать обратное было бы ровно тем преувеличением, которое вся эта публикация призвана выявлять у других. Аргумент уже и, как нам кажется, надёжнее: одна и та же категория проблемы получила от одного и того же сервиса два разных вердикта в зависимости от того, насколько правдоподобно выглядела фальсификация — а это тот тип сбоя, которого не может быть у фиксированного, проверяемого правила. DOI либо разрешается в процитированную работу, либо нет. Это не оценочное суждение, которое модель принимает с большей или меньшей уверенностью от случая к случаю — это факт, который правило проверяет одинаково каждый раз и предъявляет для него доказательство.
Каждое утверждение в этом тексте можно проверить по тому же доказательству: идентификаторы правил, различия на уровне полей и точные DOI и даты — а не прозу, утверждающую вердикт. Проверьте свою собственную библиографию так же: strictcite.com, или бесплатно проверьте одного соавтора с помощью инструмента, ради которого этот тест был построен: Fake Co-Author Checker.