1. Обнаружение
Если запросить в Crossref «Attention Is All You Need» — статью Vaswani et al. 2017 года, представившую архитектуру Transformer и процитированную более 140 000 раз[1], — вернутся пять отдельных записей. Тот же заголовок, те же восемь авторов, побайтово идентичные. Во всех пяти годом публикации указан 2025. Все пять несут DOI с префиксом 10.65215, зарегистрированным не за площадкой по информатике, а за организацией под названием Shenzhen Medical Academy of Research and Translation, через китайский препринт-хостинг.
10.65215/ysbyhc05
10.65215/mdcm8z23
10.65215/nxvz2v36
10.65215/2q58a426[2]
Мы проверили каждую запись напрямую, а не приняли результат поиска на веру: DOI разрешаются, записи Crossref реальны и проиндексированы — это не артефакт нашего собственного инструмента. У настоящей статьи 2017 года вообще нет DOI в Crossref — NeurIPS систематически не регистрирует DOI для своих статей, в отличие от площадок, индексируемых через ACL Anthology. Поэтому поиск по одному только заголовку в Crossref не может вернуть ничего настоящего; пять фальшивок — единственные доступные кандидаты.
2. Почему это важно не только для одной статьи
Гоголь построил на этом целый роман: в «Мёртвых душах» единственная реальность, которая имеет значение для чиновника, — это то, что написано в ревизской сказке, а вовсе не то, кто на самом деле жив. Пять записей на Crossref работают по той же логике: для любого инструмента, который читает реестр, а не проверяет его, все пять существуют ровно в той же мере, что и настоящая статья.
Любой инструмент, проверяющий цитаты по данным реестров, подвержен этому механизму — включая наш собственный, да и чей угодно ещё. Если правильный источник не отвечает — а у каждого реестра есть свои пробелы в охвате и периодические сбои —, единственным голосом в комнате может оказаться спам-дубликат. Значимым сигналом является согласие независимых источников, а не слово одного источника само по себе; утверждение, опирающееся ровно на один малознакомый реестр, заслуживает осознанного скептицизма, прежде чем считаться установленным фактом.
3. Это не редкость
Мы выбрали десять самых читаемых статей по ИИ из ленты Daily Papers на Hugging Face за эту неделю — реальные препринты с реальными списками литературы, не отобранные специально для этой статьи, — и прогнали их настоящие файлы .bib/.bbl, взятые прямо из исходников каждой статьи на arXiv, через те же проверки по тринадцати реестрам, что использует рабочая область StrictCite. Всего 831 ссылка; более 300 отмечены для более внимательной проверки.
Значительная часть этого — шум, а не находки, и об этом стоит сказать прямо, а не прятать за большим числом: бесключевой тариф Semantic Scholar делит один ограниченный по частоте запросов пул со всеми анонимными вызовами в интернете, и он сильно ограничивал скорость в середине этого прогона. Ссылка, которая обычно подтверждается двумя независимыми источниками, может выглядеть неподтверждённой по причинам, не имеющим отношения к цитирующей статье. Тем не менее реальные, конкретные, независимо проверяемые проблемы встречались на всём протяжении:
- В одной статье годом цитирования значилось 1609 — не год, а фрагмент DOI AAAI (10.1609/…), который какой-то инструмент для генерации библиографии, судя по всему, принял за год. Тот же паттерн — цифры, взятые из идентификатора, а не из настоящего года, — независимо друг от друга встретился ещё в трёх статьях.
- Другая статья цитировала статью о диффузионных моделях по DOI. Этот DOI ведёт к совершенно другой статье — о моделировании человеческого фактора для автономного вождения, — написанной четырьмя другими авторами, не имеющими никакого отношения к диффузионным моделям.
4. Собственные цитаты OpenAI и Meta тоже сломаны
Это не ограничивается быстро выходящими препринтами небольших команд. Одна из статей в выборке цитирует GPT-4o и Llama 3 как базовые модели; мы взяли официальный экспорт BibTeX, который обе компании публикуют для собственных статей, — напрямую с эндпоинта /bibtex/ самого arXiv, а не из стороннего менеджера цитирования.
Собственный экспорт OpenAI для GPT-4o System Card выглядит полностью так:
Простое двоеточие, указанное как соавтор, — в цитате, которую OpenAI сама публикует для собственной статьи.
Экспорт Meta для «The Llama 3 Herd of Models» сломан иначе — реальные имена людей разрезаны пополам:
Один автор, Guangyi Zhang, превращается в двух несуществующих людей: «Guangyi» и «Zhang». Та же ошибка повторяется дальше в том же списке для Yu Wang. Где-то в инструментарии, сгенерировавшем эти официальные цитаты, буквальная строка «and» оказалась внутри имени, а не только между именами — и в таком виде разошлась из двух самых ресурсно обеспеченных лабораторий индустрии в каждую статью, копирующую цитату в опубликованном виде.
Искажение не заканчивается на самой рукописи. DataCite — реестр, в который отчитывается arXiv, — принял те же самые сломанные списки авторов как официальную запись. Инструмент, считающий слово реестра истиной в последней инстанции, подтвердил бы обе записи как верные, потому что ошибка возникает у источника, а не где-то ниже по цепочке.
5. Что это не означает
Это не означает, что проверка цитат — безнадёжное дело, и не означает, что эти реестры в целом ненадёжны — в большинстве случаев, для большей части того, что они охватывают, это не так. Это означает, что «реестр так говорит» и «это правда» — два разных утверждения, и их стоит считать разными независимо от того, какой инструмент задаёт вопрос.
Доверяй, но проверяй — и это в равной мере относится к реестру, к инструменту, и к нам самим.
Чтобы проверить, как настоящий файл со списком литературы вашей собственной работы выглядит при той же процедуре: strictcite.com. Бесплатный тариф не требует карты.