7 что такое релевантность поиска

Когда пользователь хочет найти в интернете информацию, он вбивает в поисковую строку конкретный вопрос и ждёт от системы релевантной выдачи. Но, очень часто этого не происходит. Получается, что страница оказалась не релевантной. Так что такое релевантность?

Понятие релевантности

Релевантность (relevant — относящийся к делу) — соответствие текста требуемым ожиданиям. Другими словами это соответствие искомого и найденного. Значит, релевантная страница это именно то, что ожидал увидеть пользователь, делая запрос в строке поиска. Этот термин стали использовать в современных системах.

Что такое релевантность

Но как же поисковая система определяет эту релевантность, как она решает какую страницу в нужный момент следует предложить? Для этого и существует релевантность поиска, которую каждая система высчитывает с помощью различных алгоритмов. Так что такое релевантность поиска?

7 Как подогнать релевантность статьи под поисковый запрос

Когда пользователь набирает свой запрос в Google или Яндекс, система оценивает документы из своего индекса и выбирает те, которые больше соответствуют запросу. Посетители оценивают работу поисковика по релевантности. Если полученный ответ не удовлетворил пользователя, то он, возможно, больше не захочет пользоваться этой системой.

Поэтому самая главная задача для поисковых систем — найти самые релевантные документы. Это влияет не только на популярность ресурса, но и на его прибыль.

Виды релевантности поиска

понятие релевантности

  • Формальный.При помощи алгоритма происходит сравнивание запроса с видом документа в поисковой машине. В данном способе релевантность высчитывается без участия человека. Всё происходит при помощи поискового робота, по заданной формуле, на основе введенных данных.
  • Содержательный.Такой вид применяется в поисковых машинах, но для оценки качества поиска. Специалисты, которых называют асессорами, оценивают результаты поиска, сравнивая их с запросом.
  • Пертинентный.К такому виду поиска стремятся все поисковые ресурсы. В данном случае информация полностью удовлетворяет пользователя.

Любая поисковая система работает по собственному алгоритму и каждой системы существует своя фишка, но принцип у всех очень схож:

  1. Для начала проверяется, насколько часто встречается заданный вопрос или словосочетание на выбранных страницах.
  2. Идёт проверка промежутка между словами.
  3. Проверяется количество ссылок на страницу.
  4. Учитывается, каким текстом набрано словосочетание.
  5. Проверяется возраст сайта.

Количество информации в сети постоянно увеличивается, поэтому повышение релевантности очень важная задача для каждой системы поиска.

У всех ресурсов существует много страниц, которые соответствуют требованиям запроса. Алгоритм системы поиска предложит самую релевантную страницу. Так что такое релевантность страницы?

Пертинентность поиска и релевантность поисковых запросов

Как определяется релевантная страница

Основные параметры оценки страницы

  • Несмотря на то, что в каждой системе поиска свой алгоритм, принцип поиска у всех похож. Внутренняя составляющая оценки релевантности:
  • Частота употребления нужного словосочетания в написанном тексте. Если общее количество употреблений нужного словосочетания близко к установленному системой, тем выше релевантность страницы.
  • Расположение нужных слов в заголовках и подзаголовках. Когда требуемое словосочетание расположено в заголовке текста, то уровень оценки текста повышается.
  • Нужные словосочетания находятся в начале страницы. Система начинает поиск с начала страницы, поэтому, чем быстрее встретится заданный запрос, тем выше релевантность.
  • Требуемые слова в нужных местах. При наличии нужных слов в заголовках и подзаголовках релевантность повышается.
  • Присутствие синонимов. Это важная часть документа. Если в тексте присутствуют синонимы требуемых слов, система сочтёт такой текст полезным и относящимся к заданной теме.

К внешней составляющей относятся ссылки. Здесь следует обратить внимание на число ссылок с текстами. Если в текст ссылки попадает нужное словосочетание, то страница сразу повышает свою оценку.

Так же на релевантность влияет авторитетность сайта. В системах поиска любой сайт имеет рейтинг. Показатели, влияющие на рейтинг:

  • Количество ссылок, которые ведут на сайт. Это указывает на значимость сайта среди других ресурсов.
  • Соответствие сайта требуемым словам. Чем больше количество страниц, отвечающих нужным словосочетаниям, тем выше авторитет.

Конечно, существуют другие технические приемы поисковых машин, по которым они считают одну страницу релевантной, а другую нет. Их достаточно много и раскрывать их не в интересах систем, которые хотят улучшить релевантность для своих пользователей.

У всех поисковых систем:

  • Собственные задачи.
  • Различные финансовые возможности.
  • Сотрудники со своим мировоззрением и кругозором, у всех разный возраст и разное мышление.

Изучив подробно статью, вы найдете ответ на вопрос, что такое релевантность.

Источник: topkin.ru

Пертинентность

Для пользователя пертинетность, соотношение объема полезной для него информации к общему объему полученной информации, имеет решающее значение. При этом следует учитывать, что формальный запрос к системе является предметом творческого осмысления информационной потребности и не всегда точно отражает последнюю. Неумение большинством пользователей правильно формулировать запросы и получать приемлемые объемы отклика породило в конце 20 века мнение об Интернет, как об огромной информационной свалке. Достижение высокой пертинентности — основное поле конкурентной борьбы современных поисковых систем. Именно для максимального удовлетворения информационных потребностей пользователей информационно-поисковые системы сегодня максимально интеллектуализируются — получили широкое практическое применение теории и методы семантических сетей, контент-анализа и глубинного анализа текстов (Text Mining).

Что такое релевантность

05.2012

Релевантность(от лат. relevo — облегчать, поднимать) в информационном поиске означает соответствие образа документа поисковому запросу. Проще говоря — это то, насколько результат поиска полезен пользователю поисковой системы.

«Релевантная выдача» означает поисковую выдачу с качественными материалами по запрошенной теме. Нерелевантной является выдача, предоставляющая данные не соответствующие ожиданиям запроса.

Как определяется релевантность.

В упрощенном виде релевантность определяется процентом вхождения ключевого запроса к общему объему текста. Релевантным считается текст, с плотностью ключевых фраз примерно 4-7%.Их большее наличие может быть принято поисковыми системами за поисковый спам и как результат — наложение ограничивающих санкций в виде фильтров.

Естественно, алгоритм определения релевантности сложней и кроме соответствия текста учитывает:

  • наличие ключей в заголовках документа;
  • релевантность ссылок на страницу с других ресурсов;
  • репутация этих ресурсов;
  • «вес» страницы;
  • и другие нюансы.

Пертинентность

05.2012 Пертинентность( в переводе с лат. pertineo — отношусь, касаюсь) — это соответствие найденных поисковой системой материалов информационным потребностям пользователей, вне зависимости от точности текста этого запроса. Проще говоря, это соотношение полезного объёма выдачи информации к общему и удовлетворенность пользователя этими результатами.

Продемонстрировать пертинентностьможно на примере запроса: «новый фильм». В результате могут оказаться фильмы, который были новыми несколько лет назад , а то и вообще обсуждения и анонсы. Именно на улучшение пертинентностив настоящее время направлены усилия поисковых систем, чтобы в идеале каждому пользователю выдавались именно для него отобранные результаты. И чтобы организовать максимально релевантную выдачу, учитывается «новизна информации» и все больше изучаются интересы людей и их поведение, которые фиксируются в «поведенческом факторе».

Запросы пользователей

Казалось бы, с развитием технологических возможностей, современные поисковые системы должны обеспечить гарантированное нахождение информации, однако «ленивые» пользователи все же, очень часто не довольны качеством их работы. Основная масса пользователей не хочет прикладывать особых интеллектуальных усилий при формировании критериев поиска.

Удивительно низким оказывается процент использования запросов, усложненных хотя бы одним логическим или контекстным оператором. Около 80 % запросов состоят из одного или двух слов. Если и используются операторы, то это в основном булевы AND и OR. Доля использования операторов контекстной близости и логического отрицания (NOT) не превышает 1-2%.

В то же время, реализация отработки сложных запросов (которых пока не более 20%) и определяет эффективность использования времени, проводимого пользователем в Интернет. Для ввода сложных запросов требуется использование булевых и контекстных операторов, скобок, указание полей и т.п., что недоступно для среднестатистического пользователя.

Поисковые службы обычно создают два интерфейса — простой (по умолчанию) и расширенный (называемый в разных системах детальным, мощным или профессиональным), однако главная задача коммерческих поисковых служб как раз и заключается в удовлетворении информационных потребностей среднестатистического пользователя. Назовем лишь некоторые возможности языков запросов наиболее популярных систем — возможности которые есть в распоряжении пользователей, но которые используются в очень небольшой части.

Во всех современных системах реализованы булевы операторы AND, OR и NOT, а также работа со скобками. Однако в двух из них — AltaVista и Excite оператор NOT записывается в виде «AND NOT», — таким образом подчеркивается его бинарность (в математической логике оператор NOT в чистом виде — унарный). В режимах простого поиска булевы операторы реализуются не всегда указанием их в явном виде.

Например, во многих поисковх системах пробел между словами запроса по умолчанию воспринимается как оператор AND (Allthenews, Google, META и UAport). В то же время при указании опций типа «any of the words», пробел в таких системах воспринимается как OR. Кроме тог, в Alltheweb допускается использование операторов «+» и «-» перед словами фактически как синонимов операторов AND и NOT, соответственно.

Точно так же используются эти операторы в AltaVista, Excite, Lycos и Апорт. Большинство профессиональных поисковых систем обеспечивает выполнение операций контекстной близости, одна из реализаций которой — поиск выражений в кавычках. В системе Яndex режим контекстного поиска называется «поиском с расстоянием».

В общем виде ограничение по расстоянию задается выражением вида «/(n m)», где n — минимальное, а m — максимальное допустимое расстояние. В системе Апорт существует два вида ограничения по расстоянию: в словах «wN(. )», где N — число слов и в предложениях «sN(. )», где N — число предложений. Можно отметить, что у самой популярной сегодня системы Google — самый лаконичный набор операторов — «+», OR и «-» и реализована возможность поиска по фразам в кавычках.

Источник: studfile.net

Как измерить релевантность контента

Оценка контента одна из главных составляющих формулы релевантности. Знание текстовых признаков и вклад каждого из них в оценку сайта позволит приблизиться к более профессиональной работе с ресурсом. В данной статье будет рассмотрена модель, позволяющая восстановить формулу ранжирования по каждому конкретному запросу, указана значимость определение тематики сайта при продвижении по определенному запросу, а также проработан вопрос, связанного с определением неестественного текста.

Восстановление формулы ранжирования

image

Если переводить данную задачу в область математики, то входные данные можно представить набором векторов, где каждый вектор – множество характеристик каждого сайта, а координаты в векторе – параметр, по которым оценивается сайт. В описанном векторном пространстве обязательно должна быть задана функция, определяющая отношение порядка двух объектов между собой. Эта функция позволяет ранжировать объекты между собой по принципу «больше — меньше», однако при этом сказать, насколько именно одно больше или меньше другого – нельзя. Такого вида задачи относятся к задачам оценки порядковой регрессии.
Наши сотрудники разработали алгоритм на основе модели линейной регрессии с регулируемой селективностью, который позволил с определенной долей погрешности восстановить ранги сайтов и спрогнозировать изменение выдачи при соответствующих корректировках параметров сайта. Первым шагом алгоритма является обучение модели.

В данном случае обучающая выборка представляет собой результаты ранжирования сайтов в рамках одного поискового запроса. Упорядоченность сайтов в рамках поискового запроса фактически означает, что в признаковом пространстве существует некоторое направление, на которое объекты обучающей выборки должны проектироваться в нужном порядке. Это направление и является искомым в задаче восстановления формулы ранжирования. Однако судя по рис.1, таких направлений может быть много.

Рис. 1. Выбор направляющего вектора

Для решения данного вопроса был рассмотрен подход, лежащий в основе метода опорных точек, а именно – выбор такого направления, которое будет обеспечивать максимальное удаление объектов друг от друга.
Следующая задача, которая была решена — выбор стратегии обучения. Рассматривалось два варианта – сокращенная стратегия обучения, при которой учитывается порядок двух соответствующих элементов, и полная стратегия, которая учитывает весь порядок объектов. В результате экспериментов была выбрана сокращенная стратегия, которая заключается в решении следующего уравнения:(1)
image, где image— решение стандартной задачи квадратичного программирования при линейных ограничениях: image, где
image— симметричная матрица
image— вектор коэффициента
image— разница векторов характеристик

Рейтинг
( Пока оценок нет )
Загрузка ...
Заработок в интернете или как начать работать дома