Какие города привлекают больше всего внимания в Википедии? Численность населения не может ответить на этот вопрос. Как и количество туристов, объём авиаперевозок или число поисковых запросов в Google. Другую точку зрения дают просмотры страниц Википедии: они показывают, как часто пользователи открывают энциклопедическую статью, чтобы узнать что-то о том или ином месте.
Используя открытые данные Википедии и Викиданных, такой спрос на информацию можно анализировать в очень больших масштабах. Для этого рейтинга были изучены просмотры статей, связанных с городами, в англоязычной Википедии за 12 месяцев — с 1 июля 2025 года по 30 июня 2026 года. Это не рейтинг крупнейших или богатейших городов мира и не список лучших мест для путешествий. Это рейтинг внимания читателей: он показывает, какие темы, связанные с городами, пользователи англоязычной Википедии открывали чаще всего в течение этого периода.
Однако составить такой рейтинг значительно сложнее, чем просто скачать список страниц Википедии и сложить количество их просмотров.
Смотрите полное видео:
Википедия как индикатор спроса на информацию
Википедия — это не только энциклопедия. С точки зрения анализа данных её можно также рассматривать как крупномасштабный индикатор общественного спроса на информацию.
Когда читатели открывают статью, инфраструктура Wikimedia регистрирует агрегированную статистику просмотров. Эти данные доступны через Wikimedia Analytics API, а также в виде открытых дампов данных о просмотрах.
Данные, доступные через Analytics API, публикуются на условиях CC0 1.0, то есть фактически передаются в общественное достояние. Благодаря этому они особенно удобны для исследований, воспроизводимого анализа и журналистики данных.
Масштабы трафика Википедии огромны. В исследовании, опубликованном к 25-летию Википедии, Pew Research Center оценил, что в период с 2015 по 2025 год статьи Википедии получили около 1,9 триллиона просмотров, причём значительная часть этого трафика приходилась на англоязычную Википедию.
Это делает Википедию полезным источником для изучения того, что можно назвать спросом на информацию. Например, когда фильм становится популярным, люди начинают читать статьи об актёрах, которые в нём снимались. Во время выборов растёт интерес к политикам и политическим институтам. После объявления крупного научного открытия больше внимания получают связанные с ним научные статьи. Спортивные события, войны, годовщины, смерть известных людей и вирусные темы также могут оставлять хорошо заметные следы в статистике просмотров Википедии.
С городами происходит нечто похожее. Например, человек может открыть статью о Париже, планируя отпуск, прочитать об Иерусалиме после сообщения в новостях, заинтересоваться Константинополем во время изучения истории или открыть статью о Нью-Йорке после просмотра фильма. Википедия не сообщает нам, почему конкретный читатель открыл ту или иную статью, но в совокупности миллионы таких действий создают ценный показатель интереса к информации.
Данные Википедии имеют несколько важных преимуществ:
- они охватывают огромную глобальную аудиторию;
- статистика просмотров доступна по дням;
- методика измерения остаётся относительно стабильной во времени;
- данные находятся в открытом доступе;
- статьи Википедии можно связывать со структурированными объектами Викиданных;
- разные языковые версии Википедии можно анализировать отдельно или сравнивать между собой;
- длинные временные ряды позволяют выявлять всплески интереса, тренды и сезонные закономерности.
Современный ряд аналитических данных Wikimedia о просмотрах начинается 1 июля 2015 года, поэтому сегодня уже возможно проводить сопоставимый анализ за период более десяти лет. Дополнительную информацию можно найти в официальной документации Wikimedia Page View Analytics.
Однако существует важное ограничение: просмотры Википедии измеряют внимание к информации. Они не измеряют напрямую туристическую привлекательность, экономическое значение, качество жизни, популярность города среди его жителей или положительное отношение к этому месту. Кроме того, пять миллионов просмотров не обязательно означают пять миллионов разных людей: один пользователь может открыть одну и ту же статью несколько раз. Поэтому данный рейтинг следует воспринимать как рейтинг спроса на информацию в Википедии, а не как универсальный рейтинг городов мира.
Первая проблема: что именно считать «городом» в Википедии?
Прежде чем считать просмотры, необходимо определить, какие статьи Википедии относятся к городам. На первый взгляд это кажется простой задачей — но на практике всё гораздо сложнее 😉
Один из возможных подходов — использовать категории Википедии, например «Cities in the United States», «Cities in Japan», «Capitals in Europe» и тысячи других подобных категорий. Однако система категорий Википедии формировалась естественным образом на протяжении более двух десятилетий. Она включает огромное количество взаимосвязанных и вложенных категорий. Они могут пересекаться, а разные сообщества редакторов Википедии могут по-разному организовывать географические темы. Город может быть представлен прежде всего как муниципалитет, столица, центр агломерации, историческое поселение, порт, административная единица, археологический объект или сразу как несколько из этих типов.
Поэтому рекурсивный обход деревьев категорий Википедии создаёт два противоположных риска:
- ложноотрицательные результаты — реальные города, которые алгоритм не смог обнаружить;
- ложноположительные результаты — статьи, которые попали в список кандидатов, хотя на самом деле не являются статьями о городах.
Задача становится ещё сложнее, если учитывать исторические города, города-государства, районы крупных городов и административные единицы с особым статусом. Более систематичный подход заключается в том, чтобы связать статьи Википедии с соответствующими элементами Викиданных.
Использование Викиданных для поиска городов
Wikidata, или Викиданные, — это структурированная база знаний, в которой объекты представлены уникальными идентификаторами и связаны между собой машиночитаемыми утверждениями.
Например, общему понятию города в Викиданных соответствует элемент Q515 (city).
Для нашей задачи особенно важны два свойства Викиданных:
- instance of (P31) описывает, чем является конкретный объект;
- subclass of (P279) связывает более конкретный тип с более общим.
Самая очевидная идея — найти все элементы Викиданных, для которых выполняется условие instance of (P31) = city (Q515). Однако при таком подходе будет пропущено множество городов. Реальные города часто описываются с помощью гораздо более конкретных значений. Например:
- город на правах повета в Польше (Q925381);
- город в США (Q1093829);
- крупный город (Q1549591);
- город Японии (Q494721).
Подобных типов, связанных с городами, существует значительно больше. Поэтому алгоритм, проверяющий только условие P31 = Q515, даст неполный список.
Связи «subclass of» в Викиданных
Полезным первым шагом может быть изучение элементов Викиданных, которые прямо или косвенно связаны с city (Q515) посредством утверждений subclass of (P279). Это позволяет обнаружить более конкретные типы городов, которые могут использоваться в качестве значений свойства instance of (P31).
Например, в Wikidata Query Service можно использовать следующий демонстрационный SPARQL-запрос:
SELECT DISTINCT ?class ?classLabel ?directSubclass ?parent
WHERE {
?class wdt:P279* wd:Q515.
OPTIONAL {
?directSubclass wdt:P279 ?class.
}
OPTIONAL {
?class wdt:P279 ?parent.
}
SERVICE wikibase:label {
bd:serviceParam wikibase:language "en".
}
}
Выражение wdt:P279* означает, что SPARQL может пройти через ноль или более связей «subclass of». Благодаря этому можно находить всё более конкретные понятия, которые в конечном счёте связаны с более общим понятием города.
Официальный учебник по SPARQL для Викиданных описывает сходный способ поиска элементов с учётом более конкретных типов. Компактная форма запроса для поиска потенциальных городских объектов выглядит так: ?item wdt:P31/wdt:P279* wd:Q515.
Если объяснить это простыми словами, запрос означает: найти элемент, у которого значением P31 является либо непосредственно city (Q515), либо элемент, связанный с city через одну или несколько связей P279. Такой подход значительно гибче, чем поиск только тех элементов, у которых в утверждении P31 непосредственно указано Q515.
Почему Викиданные не устраняют всю неоднозначность
Структурированные данные значительно упрощают задачу, но не устраняют всех неоднозначностей. Определения понятия «город» различаются между странами и историческими периодами. Кроме того, в Викиданных существуют несколько пересекающихся способов классификации, сформированных тысячами участников проекта. Один и тот же географический объект может одновременно описываться как муниципалитет, административно-территориальная единица, город, столица, историческое поселение или археологический объект.
Проект Викиданных WikiProject Cities and Towns рассматривает некоторые из этих проблем классификации. Это особенно важно при интерпретации итогового рейтинга. В него входят как обычные современные города, например Лондон и Чикаго, так и города-государства, городские районы, исторические города и другие географические объекты, тесно связанные с понятием города. Среди примеров — Бруклин, Манхэттен, Монако, Ватикан, Вавилон, Троя, Константинополь и Мачу-Пикчу.
Поэтому наиболее точным методологическим описанием набора данных будет рейтинг объектов, связанных с городами, а не утверждение, что каждая позиция имеет один и тот же современный юридический или административный статус.
Связывание элементов Викиданных с англоязычной Википедией
После того как подходящие элементы Викиданных определены, следующим шагом становится поиск соответствующих им статей в англоязычной Википедии. Это ещё одно важное преимущество Викиданных. Элемент Викиданных может содержать ссылки на сайты (sitelinks), связывающие один и тот же объект со статьями в разных языковых разделах Википедии. Поэтому после идентификации географического объекта в Викиданных можно получить название соответствующей статьи в англоязычной Википедии.
Сбор данных о просмотрах за 12 месяцев
Период измерения для этого рейтинга: 1 июля 2025 года – 30 июня 2026 года. Данные о просмотрах Википедии можно получить либо через Wikimedia Analytics API, либо из массовых дампов просмотров страниц.
API удобно использовать, когда нужно собрать статистику для ограниченного числа заранее известных статей. Дампы данных могут быть эффективнее при обработке очень большого количества страниц.
В этом рейтинге статистика просмотров соответствует следующим параметрам API:
- project = en.wikipedia.org
- access = all-access
- agent = user
- granularity = daily
- start = 20250701
- end = 20260630
Параметр access = all-access означает, что анализ не ограничивается только просмотрами с настольных компьютеров: объединяется трафик со всех поддерживаемых способов доступа. Параметр agent=user особенно важен, поскольку Wikimedia отдельно выделяет трафик, классифицированный как поисковые роботы и другая автоматизированная активность. Официальная документация Wikimedia по просмотрам страниц объясняет различные категории трафика и правила классификации просмотров. Фильтрация автоматизированного трафика делает полученные показатели значительно более полезными в качестве приблизительной оценки реального внимания читателей.
Почему необходимо учитывать перенаправления
Существует ещё одна техническая особенность, которая может заметно повлиять на итоговый результат: перенаправления и изменения названий статей.
Предположим, что статья Википедии получила сотни тысяч просмотров под одним названием, а затем была переименована. Обычно Википедия оставляет прежнее название в виде перенаправления на новое. Поэтому читатели, переходящие по старой ссылке, всё равно попадают к тому же материалу.
С точки зрения измерения интереса к теме просмотры разных названий часто следует учитывать вместе. Однако историческая статистика просмотров привязана к названию страницы, которое фактически было запрошено. В документации Wikimedia отдельно отмечается, что просмотры перенаправлений не добавляются автоматически к просмотрам конечной статьи. Поэтому сбор статистики только по текущему основному названию статьи может привести к недооценке её исторической популярности.
Представим, например, что в первой половине исследуемого периода статья называлась City A, а в январе её переименовали в City B. Если анализировать только исторические просмотры City B, трафик, ранее записанный под названием City A, может быть потерян. Поэтому качественный анализ должен учитывать релевантные перенаправления и историю названий, а при необходимости объединять соответствующие показатели просмотров.
MediaWiki Redirects API и таблица перенаправлений могут помочь обнаружить страницы, которые сейчас перенаправляют на нужную статью. Ещё один полезный интерактивный инструмент — Pageviews Analysis, позволяющий изучать временные ряды просмотров и при необходимости учитывать перенаправления.
Не каждый просмотр означает естественный интерес
После сбора и объединения данных может показаться, что рейтинг уже готов. Но остаётся ещё одна проблема. Не каждый просмотр, классифицированный как пользовательский трафик, обязательно отражает естественный интерес читателей.
Самый известный пример — необычно высокий трафик статьи Википедии о Клеопатре. В течение длительного времени редакторы Википедии замечали, что статья о Клеопатре получает чрезвычайно много просмотров, причём этот высокий уровень сохраняется без очевидного новостного события, которое могло бы его объяснить. Этой загадкой заинтересовались участники Википедии и журналисты.
Одно из важных объяснений было связано с Google Assistant, который на некоторых устройствах Android предлагал в качестве примера голосовой команды фразу, похожую на «Show Cleopatra on Wikipedia». Это явление описано в статье, опубликованной изданием Inverse. Эта же проблема обсуждалась в материале The Conversation.
Этот пример демонстрирует важную методологическую проблему. Запросы могут исходить от реальных пользователей и реальных устройств, однако приложение, интерфейс, рекомендательная система или стандартная ссылка способны создавать огромный объём трафика, который не соответствует миллионам независимых решений людей узнать больше о конкретной теме. При исследовании популярности такой трафик способен заметно искажать рейтинг.
Выявление аномального трафика Википедии
По этой причине исходные суммы просмотров в данном исследовании проходили дополнительные проверки на наличие аномального трафика. Общий подход частично основан на методах, ранее обсуждавшихся в проекте ВикиРанк, где необычно завышенные или искусственно «разогнанные» показатели популярности анализировались с использованием дополнительных контекстных индикаторов.
К потенциальным сигналам могут относиться:
- форма дневного временного ряда просмотров;
- необычно высокий и устойчивый трафик без очевидного объясняющего события;
- крайние различия между трафиком с настольных и мобильных устройств;
- изменения количества правок;
- изменения числа активных редакторов;
- события, связанные с защитой статьи;
- изменения числа ссылок и источников;
- интерес во внешних поисковых системах;
- крупные новостные события, связанные с объектом;
- характер трафика у сопоставимых статей Википедии.
Полезный пример такого подхода можно найти в материале проекта ВикиРанк о необычных показателях популярности. Ещё одним полезным методологическим примером является исследование Википедии, опубликованное Pew Research Center в 2026 году.
Pew учитывал пользовательский трафик и исключал автоматизированную активность. Исследователи также применяли дополнительную эвристику, основанную на распределении просмотров по типам устройств: из некоторых расчётов популярности исключались страницы, у которых мобильный трафик составлял менее 5% или более 95% всех просмотров. Кроме того, были исключены несколько страниц с известными или предполагаемыми искусственными искажениями трафика, включая статью о Клеопатре.
Это показывает важный принцип: использование параметра agent=user необходимо, но для некоторых видов исследований его может быть недостаточно. Резкий всплеск просмотров сам по себе не является подозрительным. Статья о городе вполне естественным образом может получить миллионы дополнительных просмотров из-за землетрясения, войны, спортивного события, фильма, политического события или другого крупного информационного повода.
Поэтому задача состоит не просто в удалении всплесков. Важно отличать объяснимый общественный интерес от моделей трафика, которые, вероятно, возникли из-за технических механизмов или особенностей пользовательского интерфейса. Итоговый рейтинг, таким образом, основан на значениях после объединения релевантных перенаправлений, а также дополнительных проверок и корректировок аномального трафика.
50 самых просматриваемых статей, связанных с городами, в англоязычной Википедии
Ниже представлен итоговый рейтинг за период с 1 июля 2025 года по 30 июня 2026 года. Числа просмотров соответствуют значениям, использованным в исследовании после описанной обработки данных, учёта перенаправлений и проверки аномального трафика.
- Нью-Йорк (5 448 443)
- Сингапур (4 431 672)
- Гонконг (3 249 417)
- Бруклин (3 174 187)
- Лондон (3 092 746)
- Вашингтон, округ Колумбия (2 974 686)
- Лос-Анджелес (2 917 643)
- Монако (2 708 837)
- Чикаго (2 351 214)
- Дубай (2 138 711)
- Токио (1 927 396)
- Иерусалим (1 907 306)
- Париж (1 905 260)
- Мумбаи (1 768 391)
- Сан-Франциско (1 741 185)
- Торонто (1 735 944)
- Берлин (1 730 307)
- Филадельфия (1 670 222)
- Бостон (1 640 581)
- Сиэтл (1 620 036)
- Рим (1 563 788)
- Ватикан (1 545 922)
- Макао (1 543 003)
- Стамбул (1 528 192)
- Мехико (1 516 313)
- Санкт-Петербург (1 453 139)
- Атланта (1 433 038)
- Мачу-Пикчу (1 373 177)
- Чунцин (1 343 670)
- Новый Орлеан (1 321 826)
- Прага (1 318 991)
- Шанхай (1 313 562)
- Вавилон (1 312 031)
- Ванкувер (1 311 284)
- Монреаль (1 301 798)
- Лас-Вегас (1 301 113)
- Вена (1 262 813)
- Миннеаполис (1 261 474)
- Константинополь (1 252 602)
- Манхэттен (1 245 518)
- Детройт (1 238 274)
- Гибралтар (1 227 408)
- Сидней (1 220 463)
- Москва (1 219 667)
- Пекин (1 217 741)
- Амстердам (1 216 232)
- Майами (1 216 004)
- Хьюстон (1 214 556)
- Барселона (1 208 087)
- Троя (1 205 970)
Расширенная версия рейтинга представлена в этом видео.
Что показывает этот рейтинг?
Самый очевидный результат — уверенное лидерство Нью-Йорка, статья о котором получила почти 5,45 млн просмотров в обработанном наборе данных за рассматриваемый 12-месячный период. Сингапур занимает второе место с более чем 4,43 млн просмотров, а первую пятёрку дополняют Гонконг, Бруклин и Лондон.
Однако разнообразие рейтинга, пожалуй, интереснее самого первого места. Современные глобальные города — Нью-Йорк, Лондон, Токио, Париж, Дубай и Сингапур — соседствуют с местами, популярность которых в Википедии тесно связана с историей, политикой или особым административным статусом. Вавилон, Троя и Константинополь демонстрируют роль исторического интереса. Монако и Ватикан объединяют понятия города и государства. Бруклин и Манхэттен показывают, что читатели Википедии нередко ищут информацию о значимых городских территориях отдельно от города, частью которого они являются.
Появление Мачу-Пикчу также напоминает о том, что автоматический отбор объектов требует интерпретации, а не слепого принятия результатов. Эти примеры показывают важную особенность использования Википедии: читатели не разделяют своё любопытство на чёткие категории современной географии, административного права, истории, туризма и массовой культуры. Все эти мотивы в конечном счёте объединяются в одном потоке просмотров.
Рейтинги Википедии — это ещё и рейтинги понятий
Есть ещё один важный способ интерпретировать результаты. Рейтинг Википедии отчасти отражает то, как знания распределены между отдельными статьями. Например, Нью-Йорк имеет собственную статью, но чрезвычайно популярные отдельные статьи есть также у Бруклина и Манхэттена. Поэтому внимание читателей, интересующихся Нью-Йорком, может распределяться между несколькими страницами. В случае других городов гораздо большая доля соответствующей информации может быть сосредоточена в одной статье.
Это означает, что количество просмотров нельзя интерпретировать как полностью стандартизированный показатель популярности самих городов. Оно измеряет внимание к понятиям и структуре статей Википедии, представляющим эти места. Это не обязательно является недостатком. Наоборот, такой подход даёт дополнительную информацию о том, какие отдельные части или аспекты городской территории привлекают самостоятельный интерес читателей.
Создать рейтинг проще, чем определить, что он на самом деле означает
Простое сложение чисел — самая лёгкая часть создания рейтинга популярности Википедии. Основная сложность возникает до и после этого:
- определить, что именно считать городом;
- проследить связи instance of (P31) и subclass of (P279) в Викиданных;
- найти более конкретные типы, связанные с городами, а не проверять только Q515;
- связать элементы Викиданных со статьями англоязычной Википедии;
- собрать ежедневную статистику просмотров;
- восстановить перенаправления и изменения названий статей;
- отфильтровать известный автоматизированный трафик;
- проверить, действительно ли необычное количество просмотров отражает естественный спрос на информацию;
- последовательно интерпретировать неоднородные объекты.
Именно эти методологические решения определяют, что в действительности означает итоговый рейтинг. Сильная сторона экосистемы Wikimedia заключается в том, что значительная часть необходимой инфраструктуры находится в открытом доступе. Википедия предоставляет энциклопедические статьи, Викиданные — машиночитаемый семантический слой, MediaWiki API — информацию о связях между страницами, а Wikimedia Analytics — исторические показатели внимания читателей.
Вместе эти ресурсы позволяют взглянуть на города с необычной точки зрения. Вместо того чтобы спрашивать только «Сколько людей там живёт?», «Сколько туристов туда приезжает?» или «Насколько велика экономика этого города?», можно задать другой вопрос: насколько велик информационный интерес к этому месту в Википедии?
С этой точки зрения Википедия — не просто энциклопедия. Это также огромная, постоянно меняющаяся, несовершенная, но весьма показательная обсерватория человеческого любопытства.