Википедия представляет собой огромный массив человеческих знаний. Крупнейшая языковая версия, английская Википедия, содержит более 65,5 миллионов страниц, включая 7,17 миллиона статей (без учёта перенаправлений). Эту масштабную сеть соединяют 1,63 миллиарда уникальных ссылок между страницами. На основе анализа этого набора данных были определены самые цитируемые статьи английской Википедии.

Размышляя о том, какие статьи Википедии могут быть наиболее цитируемыми, можно предположить, что лидирующие позиции займут такие значимые исторические темы, как «Соединённые Штаты Америки» или «Вторая мировая война». Однако только обработка полного структурного графа Википедии и подсчёт количества входящих ссылок, или цитирований (то есть точного числа статей, ссылающихся на конкретную страницу), позволяет выявить настоящих лидеров рейтинга.

Посмотреть полное видео:

Самые цитируемые статьи

Анализ дампов английской Википедии за май 2026 года позволил составить рейтинг самых цитируемых статей. Ниже представлены 50 самых цитируемых статей Википедии с указанием количества входящих ссылок (цитирований) в скобках:

  1. ISBN (1,640,723)
  2. Geographic coordinate system (1,257,791)
  3. Digital object identifier (711,302)
  4. Wayback Machine (675,714)
  5. Wikidata (509,749)
  6. ISSN (505,509)
  7. Taxonomy (biology) (496,532)
  8. Global Biodiversity Information Facility (464,041)
  9. Time zone (455,438)
  10. United States (437,284)
  11. IMDb (406,083)
  12. Open Tree of Life (399,021)
  13. Binomial nomenclature (392,021)
  14. Animal (376,148)
  15. Catalogue of Life (368,553)
  16. Interim Register of Marine and Nonmarine Genera (313,153)
  17. INaturalist (295,815)
  18. Encyclopedia of Life (275,091)
  19. Association football (274,176)
  20. Daylight saving time (273,633)
  21. Wikispecies (267,809)
  22. France (265,679)
  23. Semantic Scholar (253,534)
  24. OCLC (251,623)
  25. Record label (242,084)
  26. Arthropod (241,604)
  27. National Center for Biotechnology Information (237,741)
  28. PubMed (230,779)
  29. World War II (227,499)
  30. Music genre (221,588)
  31. Pancrustacea (216,225)
  32. Insect (214,763)
  33. Germany (214,199)
  34. United Kingdom (213,409)
  35. Record producer (200,934)
  36. The New York Times (200,715)
  37. Political party (194,625)
  38. Australia (190,367)
  39. Italy (189,720)
  40. Synonym (taxonomy) (185,121)
  41. India (184,424)
  42. Bibcode (174,702)
  43. Integrated Taxonomic Information System (174,431)
  44. Surname (171,530)
  45. Japan (168,687)
  46. Russia (166,259)
  47. Canada (165,593)
  48. Spain (162,773)
  49. UTC+02:00 (160,743)
  50. Poland (160,034)

Более полный рейтинг представлен в этом видео, а также опубликован на Hugging Face и Kaggle.

Методология: обработка данных

Для создания этого рейтинга недостаточно простого скрипта, загружающего содержимое статей Википедии (например, в формате вики-разметки) — такой подход был бы слишком медленным и не учитывал бы скрытую сложность структуры сайта. Вместо этого обрабатываются сырые SQL-дампы баз данных Википедии. Для обеспечения более высокой точности конвейер обработки данных тщательно объединяет четыре ключевых файла (из Wikimedia Downloads по состоянию на май 2026 года):

  • 1. Основной реестр статей
    Процесс начинается с файла enwiki-20260501-page.sql.gz (см. таблицу page). Этот файл присваивает каждой странице Википедии уникальный числовой идентификатор. Он позволяет отфильтровать страницы обсуждений и пользовательские страницы, оставляя только полноценные энциклопедические статьи (пространство имён: 0). Кроме того, он указывает, является ли страница перенаправлением (англ. «redirect»).
  • 2. Транслятор целей ссылок
    В современной архитектуре Википедии ссылки в базе данных указывают не напрямую на текст, а на числовые идентификаторы целей. Файл enwiki-20260501-linktarget.sql.gz (см. таблицу linktarget) используется как словарь, переводящий эти идентификаторы обратно в читаемые названия статей.
  • 3. Механизм разрешения перенаправлений

    Википедия активно использует страницы-алиасы (например, «USA» перенаправляет на «United States»). Файл enwiki-20260501-redirect.sql.gz (см. таблицу redirect) используется для построения карты всех перенаправлений, чтобы можно было корректно определить конечную страницу назначения.

  • 4. Граф связей

    Наконец, обрабатывается огромный файл enwiki-20260501-pagelinks.sql.gz (см. таблицу pagelinks). Это сырой граф, содержащий миллиарды связей и описывающий простое отношение: «Страница А содержит ссылку на идентификатор цели Б».

Строгие правила подсчёта

После объединения файлов базы данных итоговые показатели цитирования вычисляются по строгому набору правил, обеспечивающих корректность рейтинга:

  • Только полноценные статьи: Учитываются только ссылки, исходящие из реальных статей (пространство имён: 0). Ссылки со страниц обсуждений, категорий или пользовательских профилей полностью исключаются. Кроме того, игнорируются ссылки, исходящие из страниц-перенаправлений.
  • Полная дедупликация: Учитываются только уникальные внутренние ссылки. Одна исходная статья может дать максимум одно цитирование целевой статье. Даже если статья ссылается на одну и ту же цель несколько раз в тексте (или через различные алиасы перенаправлений), это не приведёт к искусственному завышению показателя цитирования. Связь учитывается строго один раз.

Проблема: разрешение алиасов и обеспечение уникальности цитирований

Идентификаторы целей, указывающие на перенаправления

Одной из технических сложностей при построении этого рейтинга является обработка случаев, когда цель ссылки указывает непосредственно на перенаправление. Идентификатор цели может — и очень часто действительно — указывать на имя перенаправления.

Когда редактор Википедии в статье на языке вики-разметки вводит [[USA]] (ссылку на статью под названием «USA»), база данных присваивает этой ссылке идентификатор цели. Однако «USA» не является конечной статьёй: в таблице page (Основной реестр статей) эта страница существует как перенаправление (помеченное флагом page_is_redirect = 1). Если учитывать такие случаи наивно, «USA» и «United States» получили бы отдельные доли цитирований, что исказило бы рейтинг.

Конвейер обработки данных динамически решает эту проблему:

  1. Идентификатор цели ссылки извлекается из Графа связей.
  2. С помощью Транслятора целей ссылок определяется идентификатор страницы, соответствующий данной цели.
  3. Основной реестр статей проверяется, чтобы определить, помечена ли эта страница как перенаправление.
  4. Если да, скрипт перехватывает ссылку и обращается к Механизму разрешения перенаправлений, чтобы определить идентификатор конечной страницы.
  5. После этого цитирование корректно перенаправляется основной статье (например, «United States»).

Обеспечение уникальности цитирований (дедупликация)

Ещё одним важным аспектом методологии является строгая дедупликация: учитывается только одна уникальная ссылка от данной исходной статьи к целевой статье. Если одна статья содержит несколько ссылок на одну и ту же страницу, это не приводит к искусственному увеличению показателя цитирования.

Кроме того, поскольку перенаправления полностью разрешаются до финального этапа подсчёта, дедупликация автоматически применяется и к алиасам. Например, если статья содержит ссылку на «USA», а ниже по тексту — ещё одну ссылку на «United States», конвейер обработки данных разрешает «USA» в «United States». Затем обе ссылки распознаются как указывающие на одну и ту же целевую сущность, и дубликат удаляется. В результате из анализируемой статьи «United States» получает ровно одно цитирование.

Преимущества SQL-подхода

Использование сырых SQL-баз данных вместо разработки программы для извлечения вики-текста и его разбора (например, с помощью регулярных выражений) имеет три ключевых преимущества.

Во-первых, текст Википедии крайне неоднороден — ссылки часто встроены в сложные шаблоны, инфобоксы или макросы форматирования (что и создаёт огромное количество ссылок к ISBN и DOI, находящихся в верхней части рейтинга). Использование предварительно скомпилированных SQL-дампов позволяет анализировать именно те ссылки, которые были корректно обработаны собственными серверами Википедии, обеспечивая более высокую точность.

Во-вторых, наивный метод анализа текста разделял бы популярность темы между её алиасами и, вероятно, многократно учитывал бы одни и те же ссылки на одной странице. Жёсткая интеграция таблицы redirect и строгий подсчёт только уникальных пар позволяют консолидировать данные, обеспечивая точное отражение реальной структурной значимости статьи.

В-третьих, попытка собрать такой объём данных с помощью веб-скрейпинга (HTTP-запросов) была бы крайне неэффективной вычислительно, потребовала бы месяцев обработки и создала бы ненужную нагрузку на серверы Википедии. Использование SQL-дампов позволяет обработать и проанализировать весь граф из 1,63 миллиарда ссылок офлайн с высокой эффективностью.

Шаблоны, карточки и автоматически генерируемые ссылки

Возникает закономерный вопрос: не формируются ли подобные рейтинги в значительной степени за счёт шаблонов, карточек (инфобоксов), шаблонов цитирования и других автоматически генерируемых элементов. Действительно, значительная часть внутренней структуры ссылок Википедии создаётся именно такими механизмами.

Основная сложность заключается в определении границы: что именно следует учитывать. Если принимать во внимание только ссылки, непосредственно видимые в исходном вики-тексте, то будет упущено множество важных связей — включая ссылки, создаваемые встроенными шаблонами, инфобоксами и модулями, использующими данные из Викиданных.

Стоит также отметить, что некоторые ссылки, изначально добавленные вручную в вики-текст, со временем могли быть заменены шаблонами ради удобства, единообразия или стандартизации. В результате различие между «ручными» и «сгенерированными шаблонами» ссылками не всегда является однозначным.

Отдельный рейтинг, основанный исключительно на ссылках, присутствующих непосредственно в тексте статей (вики-тексте), безусловно, был бы интересен. Однако такой подход потребовал бы множества дополнительных методологических решений относительно того, что следует учитывать, а что нет. Например, следует ли включать ссылки из раздела «Примечания», навигационных шаблонов, технических шаблонов или элементов, автоматически генерируемых на основе метаданных.

По этой причине данное исследование опирается на полностью обработанный граф внутренних ссылок, содержащийся в SQL-дампах баз данных Википедии и отражающий реальную структуру связей, формируемую программным обеспечением MediaWiki.