Показаны сообщения с ярлыком интернет-поиск. Показать все сообщения
Показаны сообщения с ярлыком интернет-поиск. Показать все сообщения

пятница, 18 декабря 2015 г.

Baidu – интернет-­окно в Азию

 

Алексей КУТОВЕНКО

В Baidu знания английского недостаточно.

Китайская Baidu — одна из крупнейших поисковых машин мира. Разумеется, это и привлекательная рекламная площадка. Однако ее использование связано с рядом специфических проблем.

Рост интереса к Baidu связан со смягчением регулирования электронной коммерции в КНР. Теперь заниматься такой деятельностью могут и иностранные компании, что открывает новые возможности для выхода на крупный китайский рынок и проведения масштабных рекламных кампаний.

Baidu уверенно удерживает лидерство по популярности в Китае. Заметен поисковик и в мировых масштабах: на его долю приходится около 5 % мировых доходов от интернет-рекламы.

Microsoft и Baidu заключили соглашение, в соответствии с которым китайская поисковая машина предоставляет встроенный поиск для китайских пользователей браузера Edge из Windows 10. Все новые пользователи Edge в Китае будут переключаться на Baidu, а этот сервис — применяться в качестве стартовой страницы браузера. В свою очередь по запросам, связанным с Windows, китайский поисковик будет выдавать специальные ссылки для скачивания Windows 10.

Baidu сотрудничает с крупной онлайновой торговой площадкой Alibaba и совместно с финансовой группой CITIC планирует выйти на банковскую сферу.

Одной из особенностей работы с китайской платформой является прохождение каждым рекламодателем обязательной сертификации. Для допуска к сертификации иностранная компания должна получить все соответствующие лицензии и сертификаты для осуществления ею деятельности в КНР. Кстати, Baidu активно сотрудничает с госслужбами страны.

Поисковик выдвигает ряд требований к веб-сайту, для которого планируется рекламная кампания. Сайт должен быть ориентирован на рынок Поднебесной и оформлен на китайском языке. Желателен именно комплексный сайт, предоставляющий исчерпывающую информацию о товарах или услугах, а не переведенная страница-лендинг.

Для сертификации потребуются заранее подготовленные и переведенные копии сертификатов, разрешений и других документов, связанных с бизнесом нового рекламодателя. Более того, Baidu может запросить даже скриншоты сайтов со сведениями о надлежащей государственной регистрации в стране учреждения фирмы.

После регистрации на рекламной площадке и получения иностранной компанией сертификата рекламодателя Baidu предоставляет собственную оригинальную платформу, инструменты которой придется изучать самостоятельно. Интерфейс выполнен на упрощенном китайском языке, что потребует либо дополнительной подготовки персонала, либо работ по локализации информационных материалов.

Существуют и некоторые пожелания в отношении рекламной кампании на площадке Baidu, в частности размещение сайта на китайском хостинге. Если предусмотрены онлайн-платежи, следует подключиться к работающим в КНР системам, например Alipay или UnionPay.

Использование Baidu в качестве рекламной площадки — намного более трудная задача, чем применение аналогичных инструментов глобальных поисковиков. Причем не только из-за потребности в специалистах, свободно владеющих китайским языком. Тем не менее преимущества Baidu перекрывают недостатки, поэтому количество иностранных брендов, подключающихся к этой рекламной площадке, неуклонно растет. Тех, кто планирует активное продвижение на рынки Поднебесной и других азиатских стран, с каждым годом становится все больше.

Опубликовано: ”Белорусы и рынок” № 47 (1180) 12 - 18 декабря 2015 г.

вторник, 19 августа 2014 г.

Nigma. Русский метапоиск

Не существует ни одного поисковика, который бы индексировал весь интернет целиком. Как известно, основной способ пополнения баз интернет-поисковиков новыми страницами – работа программ-«пауков», роботов, которые находят новые ссылки и ставят в очередь на индексирование свежие страницы. Некоторые сайты будут найдены и проиндексированы пауками нескольких поисковиков. Однако всегда будет существовать определенный процент страниц, которые нашел только один из роботов.

В результате, хоть базы универсальных поисковиков во многом пересекаются, всегда существует определенный процент страниц, имеющихся в базе только одного конкретного поисковика. Отсюда происходит одно важное для нас практическое следствие: если пользоваться только одним поисковиком, даже самым крупным, мы априори будем терять некоторый процент результатов только потому, что их пропустил его робот.
В то же время они могут быть благополучно проиндексированы другим поисковиком. Метапоисковая система, принимая запрос от пользователя, опрашивает сразу несколько других поисковиков, объединяет и обрабатывает полученные результаты и выдает их единым списком. Такой подход существенно экономит наше время и усилия, которые были бы затрачены на самостоятельный поход по нескольким поисковикам.
Сейчас сложились два основных направления развития таких систем: универсальные и тематические метапоисковики. В первом случае опрашиваются базы крупных универсальных поисковиков, что придает поиску значительную широту. Во втором случае поисковик опрашивает тематические ресурсы. Это, как правило, либо системы, работающие с определенным видом контента, например, видеохостингами, или же сайтами определенной тематики, например, метапоиск отелей, товаров или решения других подобных задач.
Лучшей универсальной метапоисковой системой на русском языке, по моему мнению, является проект Nigma (nigma.ru). Это один из тех приятных случаев, когда с удовлетворением можно отметить, что русский поисковый сервис по своим базовым возможностям абсолютно не уступает лучшим зарубежным аналогам, а по дополнительным возможностям, пожалуй, и превосходит их.
Nigma уже не новичок на поисковом рынке: как-никак восьмой год на арене. Специализация системы – контент на русском языке. Соответственно и выбор внешних поисковиков, к которым обращается данная система, продиктован в первую очередь стремлением получить максимальный охват русского контента. Посмотреть на этот список можно открыв меню «Поисковики», расположенное под строкой запроса прямо на стартовой странице сервиса.
Используется шесть крупных баз, содержащих сведения о русскоязычных страницах – от Google и Яндекса до далеко не такой популярной в настоящее время AltaVista. Охват в результате получается действительно хороший. При желании можно отключать в настройках использование той или иной базы, а то и вообще оставить какой-нибудь один поисковик и использовать Nigma как промежуточный интерфейс. В этом есть смысл, поскольку получаемые в выдаче ссылки Nigma подвергает собственной обработке, применяя при этом технологию кластеризации результатов.
Работает эта интересная технология следующим образом. Найдя определенный массив страниц, в тексте которых встречаются заданные пользователем в запросе ключевые слова, система начинает с использованием статистических методов искать в них другие ключевые слова, которые встречаются вместе с заданными пользователем. С высокой долей вероятности это различные аспекты первоначального пользовательского запроса.
Выявив такие дополнительные ключевые слова, поисковик формирует подмножества-кластеры, в которые попадают страницы с разными выявленными ключевыми словами. В отличие от веб-каталогов и тегирования здесь не участвует человек, все происходит автоматически. Кластеры формируются не заранее, а непосредственно в момент поступления запроса. Поскольку в каждом кластере производится собственное ранжирование, на поверхность, то есть на первую страницу выдачи, получают шанс попасть ссылки, которые при стандартной обработке запроса были бы благополучно зарыты где-нибудь в третьей-четвертой десятке результатов. Кроме того, результаты анализа ссылок в рамках отдельных кластеров используются для последующей сортировки результатов, уточнения позиций сайтов в итоговой выдаче
Конечно, аналогичного эффекта можно добиться и самостоятельно уточнив запрос, добавив к нему дополнительные ключевые слова. Однако для того, чтобы это сделать, такие слова нужно знать. Если мы ищем по новой или незнакомой теме, в нашем поисковом «словаре» таких уточняющих слов может просто не быть. Для того чтобы они появились, понадобится полистать выдачу, открыть какое-то количество страниц, ознакомиться с текстами. Другими словами – потратить свое время. Автоматическая кластеризация как раз и помогает нам сэкономить это время, сразу же предлагая эти варианты и выстраивая свою выдачу для каждого уточненного запроса.
Посмотреть на работу кластерной системы Nigma можно на странице результатов поиска. Самое интересное происходит в боковой панели «Фильтр» — именно здесь выводятся результаты кластеризации. Выглядят они в виде иерархического списка – кластеры могут быть вложенными, если такой уровень уточнения запроса был получен в ходе анализа. Эту панель можно использовать для быстрого уточнения запроса. Работает она как на добавление новых ключевых слов, так и на исключение ненужных, приносящих в выдачу информационный шум.
Если мы щелкаем по ссылке в списке фильтра, то переходим в соответствующий кластер. Если отмечаем кластер «птичкой» — его ссылки получают преимущество при сортировке текущей выдачи. Красный крестик исключает страницы отмеченного кластера из выдачи. Присутствует и расширенный поиск, оснащенный привычным набором инструментов составления запроса с использованием логических операторов.
Кроме этого ударной особенности – метапоиска с кластеризацией, Nigma может предложить немало любопытных дополнительных инструментов. Первый же вспомогательный инструмент, с которым мы сталкиваемся – это автоподсказка в поле поиска. Здесь не просто показываются предложения по дополнению слов, но и сразу же приводятся адреса лучших сайтов по предполагаемому запросу. Нельзя пройти мимо способностей «Нигмы» по исправлению ошибок в запросах – система способна распознать несколько опечаток в слове, набранном в неправильной раскладке.
Собственно в списке выдачи также присутствуют необычные и полезные инструменты. Самый, пожалуй, полезный – автоматическая генерация таблиц на основе найденных на страницах данных. Такую таблицу можно не только посмотреть на странице выдачи, но и скачать в формате CSV.
Кроме прочего, «Нигма» отличается нестандартной подборкой специализированных вертикальных баз. Если поиск изображений практически целиком повторяет результаты Яндекса, не предлагает интересных инструментов и, в общем-то, присутствует, прямо скажем, для галочки, то другие базы заслуживают внимания.
Раздел «Математика» демонстрирует так называемый фактографический поиск. Это значит, что нам выдаются прямые ответы на вопросы, а не ссылки на внешние сайты. В данном случае в качестве запросов выступают математические задачки и уравнения. Надо сказать, что в «Математике» довольно удобно решен ввод различных математических конструкций в одну строку поля запроса: где-то используются стандартные символы, где-то можно просто написать «Логарифм такой-то по такому-то основанию» и система вас поймет.
Полный перечень задач, решаемых «Нигмой» вынесен в отдельный раздел справки поисковика. Выбор, сразу скажу, очень даже неплохой. Но самое забавное – это, конечно же, виртуальная доска на странице выдачи, на которую выводится ход решения введенного уравнения, причем, если вариантов решения несколько, демонстрируются все.
Кроме этого Nigma умеет решать задачки по химии. Принцип работы такой же: записываем в поле поиска химическое выражение или же словами описываем нужную реакцию и получаем ответ. Как и в «Математике», здесь также выводится панель с описанием хода реакции.
База «Книги» устроена попроще. По сути, это поиск по ряду сайтов крупных онлайновых электронных библиотек. Как и в веб-поиске, здесь работает панель фильтров, позволяющая быстро уточнить запрос с помощью кластеров. Инструментов, специализированных именно для поиска книг здесь немного. Мы не можем управлять выбором формата книги, в выдачу нередко попадает шум, относящийся не к текстам собственно книг, а к текстам на страницах сайтов-библиотек. Так что база полезная, но явно не лучшая из доступных в Сети систем поиска электронных книг.
Музыкальный поиск Nigma базируется на опросе известных ресурсов с музыкой, предлагаемой в свободном доступе. Подход Nigma интересен оформлением страницы выдачи. Поскольку индексируются не только имена файлов, но и доступные теги, Nigma умеет собирать разрозненные файлы в альбомы, предлагает фильтры жанров и исполнителей, которые доступны на боковой панели. Есть онлайновый плеер и прямые ссылки на файлы – индексируются только находящиеся в открытом доступе ресурсы.
Относительно недавно Nigma обзавелась собственными базами торрентов и мини-игр. Поиск торрентов решен способом, аналогичным поиску книг и музыки: Nigma индексирует группу открытых трекеров и предлагает в своей выдачи объединенные результаты. Поисковая выдача предоставляется в виде таблицы с привычными для пользователей трекеров сведениями: размером раздачи, количеством сидеров и личеров. Щелчок по ссылке напрямую загружает torrent-файл без перехода на страницу трекера.
База «Мини-игры» работает с открытыми каталогами игрушек. Можно искать по ключевому слову или же воспользоваться каталогом, в котором игрушки распределены по жанрам. Все ссылки в выдаче – прямые, так что скачать игры можно без лишних переходов на проиндексированные «Нигмой» сайты.

24.09.2013

Опубликовано: Upgrade Digital № 629

http://www.upweek.ru/nigma.-russkij-metapoisk.html 

Nigma. Русский метапоиск

Не существует ни одного поисковика, который бы индексировал весь интернет целиком. Как известно, основной способ пополнения баз интернет-поисковиков новыми страницами – работа программ-«пауков», роботов, которые находят новые ссылки и ставят в очередь на индексирование свежие страницы. Некоторые сайты будут найдены и проиндексированы пауками нескольких поисковиков. Однако всегда будет существовать определенный процент страниц, которые нашел только один из роботов.

В результате, хоть базы универсальных поисковиков во многом пересекаются, всегда существует определенный процент страниц, имеющихся в базе только одного конкретного поисковика. Отсюда происходит одно важное для нас практическое следствие: если пользоваться только одним поисковиком, даже самым крупным, мы априори будем терять некоторый процент результатов только потому, что их пропустил его робот.
В то же время они могут быть благополучно проиндексированы другим поисковиком. Метапоисковая система, принимая запрос от пользователя, опрашивает сразу несколько других поисковиков, объединяет и обрабатывает полученные результаты и выдает их единым списком. Такой подход существенно экономит наше время и усилия, которые были бы затрачены на самостоятельный поход по нескольким поисковикам.
Сейчас сложились два основных направления развития таких систем: универсальные и тематические метапоисковики. В первом случае опрашиваются базы крупных универсальных поисковиков, что придает поиску значительную широту. Во втором случае поисковик опрашивает тематические ресурсы. Это, как правило, либо системы, работающие с определенным видом контента, например, видеохостингами, или же сайтами определенной тематики, например, метапоиск отелей, товаров или решения других подобных задач.
Лучшей универсальной метапоисковой системой на русском языке, по моему мнению, является проект Nigma (nigma.ru). Это один из тех приятных случаев, когда с удовлетворением можно отметить, что русский поисковый сервис по своим базовым возможностям абсолютно не уступает лучшим зарубежным аналогам, а по дополнительным возможностям, пожалуй, и превосходит их.
Nigma уже не новичок на поисковом рынке: как-никак восьмой год на арене. Специализация системы – контент на русском языке. Соответственно и выбор внешних поисковиков, к которым обращается данная система, продиктован в первую очередь стремлением получить максимальный охват русского контента. Посмотреть на этот список можно открыв меню «Поисковики», расположенное под строкой запроса прямо на стартовой странице сервиса.
Используется шесть крупных баз, содержащих сведения о русскоязычных страницах – от Google и Яндекса до далеко не такой популярной в настоящее время AltaVista. Охват в результате получается действительно хороший. При желании можно отключать в настройках использование той или иной базы, а то и вообще оставить какой-нибудь один поисковик и использовать Nigma как промежуточный интерфейс. В этом есть смысл, поскольку получаемые в выдаче ссылки Nigma подвергает собственной обработке, применяя при этом технологию кластеризации результатов.
Работает эта интересная технология следующим образом. Найдя определенный массив страниц, в тексте которых встречаются заданные пользователем в запросе ключевые слова, система начинает с использованием статистических методов искать в них другие ключевые слова, которые встречаются вместе с заданными пользователем. С высокой долей вероятности это различные аспекты первоначального пользовательского запроса.
Выявив такие дополнительные ключевые слова, поисковик формирует подмножества-кластеры, в которые попадают страницы с разными выявленными ключевыми словами. В отличие от веб-каталогов и тегирования здесь не участвует человек, все происходит автоматически. Кластеры формируются не заранее, а непосредственно в момент поступления запроса. Поскольку в каждом кластере производится собственное ранжирование, на поверхность, то есть на первую страницу выдачи, получают шанс попасть ссылки, которые при стандартной обработке запроса были бы благополучно зарыты где-нибудь в третьей-четвертой десятке результатов. Кроме того, результаты анализа ссылок в рамках отдельных кластеров используются для последующей сортировки результатов, уточнения позиций сайтов в итоговой выдаче
Конечно, аналогичного эффекта можно добиться и самостоятельно уточнив запрос, добавив к нему дополнительные ключевые слова. Однако для того, чтобы это сделать, такие слова нужно знать. Если мы ищем по новой или незнакомой теме, в нашем поисковом «словаре» таких уточняющих слов может просто не быть. Для того чтобы они появились, понадобится полистать выдачу, открыть какое-то количество страниц, ознакомиться с текстами. Другими словами – потратить свое время. Автоматическая кластеризация как раз и помогает нам сэкономить это время, сразу же предлагая эти варианты и выстраивая свою выдачу для каждого уточненного запроса.
Посмотреть на работу кластерной системы Nigma можно на странице результатов поиска. Самое интересное происходит в боковой панели «Фильтр» — именно здесь выводятся результаты кластеризации. Выглядят они в виде иерархического списка – кластеры могут быть вложенными, если такой уровень уточнения запроса был получен в ходе анализа. Эту панель можно использовать для быстрого уточнения запроса. Работает она как на добавление новых ключевых слов, так и на исключение ненужных, приносящих в выдачу информационный шум.
Если мы щелкаем по ссылке в списке фильтра, то переходим в соответствующий кластер. Если отмечаем кластер «птичкой» — его ссылки получают преимущество при сортировке текущей выдачи. Красный крестик исключает страницы отмеченного кластера из выдачи. Присутствует и расширенный поиск, оснащенный привычным набором инструментов составления запроса с использованием логических операторов.
Кроме этого ударной особенности – метапоиска с кластеризацией, Nigma может предложить немало любопытных дополнительных инструментов. Первый же вспомогательный инструмент, с которым мы сталкиваемся – это автоподсказка в поле поиска. Здесь не просто показываются предложения по дополнению слов, но и сразу же приводятся адреса лучших сайтов по предполагаемому запросу. Нельзя пройти мимо способностей «Нигмы» по исправлению ошибок в запросах – система способна распознать несколько опечаток в слове, набранном в неправильной раскладке.
Собственно в списке выдачи также присутствуют необычные и полезные инструменты. Самый, пожалуй, полезный – автоматическая генерация таблиц на основе найденных на страницах данных. Такую таблицу можно не только посмотреть на странице выдачи, но и скачать в формате CSV.
Кроме прочего, «Нигма» отличается нестандартной подборкой специализированных вертикальных баз. Если поиск изображений практически целиком повторяет результаты Яндекса, не предлагает интересных инструментов и, в общем-то, присутствует, прямо скажем, для галочки, то другие базы заслуживают внимания.
Раздел «Математика» демонстрирует так называемый фактографический поиск. Это значит, что нам выдаются прямые ответы на вопросы, а не ссылки на внешние сайты. В данном случае в качестве запросов выступают математические задачки и уравнения. Надо сказать, что в «Математике» довольно удобно решен ввод различных математических конструкций в одну строку поля запроса: где-то используются стандартные символы, где-то можно просто написать «Логарифм такой-то по такому-то основанию» и система вас поймет.
Полный перечень задач, решаемых «Нигмой» вынесен в отдельный раздел справки поисковика. Выбор, сразу скажу, очень даже неплохой. Но самое забавное – это, конечно же, виртуальная доска на странице выдачи, на которую выводится ход решения введенного уравнения, причем, если вариантов решения несколько, демонстрируются все.
Кроме этого Nigma умеет решать задачки по химии. Принцип работы такой же: записываем в поле поиска химическое выражение или же словами описываем нужную реакцию и получаем ответ. Как и в «Математике», здесь также выводится панель с описанием хода реакции.
База «Книги» устроена попроще. По сути, это поиск по ряду сайтов крупных онлайновых электронных библиотек. Как и в веб-поиске, здесь работает панель фильтров, позволяющая быстро уточнить запрос с помощью кластеров. Инструментов, специализированных именно для поиска книг здесь немного. Мы не можем управлять выбором формата книги, в выдачу нередко попадает шум, относящийся не к текстам собственно книг, а к текстам на страницах сайтов-библиотек. Так что база полезная, но явно не лучшая из доступных в Сети систем поиска электронных книг.
Музыкальный поиск Nigma базируется на опросе известных ресурсов с музыкой, предлагаемой в свободном доступе. Подход Nigma интересен оформлением страницы выдачи. Поскольку индексируются не только имена файлов, но и доступные теги, Nigma умеет собирать разрозненные файлы в альбомы, предлагает фильтры жанров и исполнителей, которые доступны на боковой панели. Есть онлайновый плеер и прямые ссылки на файлы – индексируются только находящиеся в открытом доступе ресурсы.
Относительно недавно Nigma обзавелась собственными базами торрентов и мини-игр. Поиск торрентов решен способом, аналогичным поиску книг и музыки: Nigma индексирует группу открытых трекеров и предлагает в своей выдачи объединенные результаты. Поисковая выдача предоставляется в виде таблицы с привычными для пользователей трекеров сведениями: размером раздачи, количеством сидеров и личеров. Щелчок по ссылке напрямую загружает torrent-файл без перехода на страницу трекера.
База «Мини-игры» работает с открытыми каталогами игрушек. Можно искать по ключевому слову или же воспользоваться каталогом, в котором игрушки распределены по жанрам. Все ссылки в выдаче – прямые, так что скачать игры можно без лишних переходов на проиндексированные «Нигмой» сайты.

24.09.2013

Опубликовано: Upgrade Digital № 629

http://www.upweek.ru/nigma.-russkij-metapoisk.html 

четверг, 27 февраля 2014 г.

Кластерные метапоисковики PolyMeta и Yippy

Идея метапоиска в интернете на бумаге выглядит гладко и заманчиво: обращаемся к максимальному количеству лучших баз, объединяем выдачу и получаем широкий охват источников по интересующей нас теме. Вот только реализовать это на практике достаточно сложно, есть немало примеров, когда в теории более продвинутые метапоисковые машины проигрывали по качеству результатов привычным универсальным поисковикам. Здесь нужны оригинальные решения и герои нашего обзора готовы их предложить.

Чуть ли не главная проблема метапоиска – отбор и сортировка результатов. Один из основных способов ее преодоления – кластеризация выдачи. Что касается русского метапоиска, то на рынке есть однозначный лидер – система Nigma, о которой мы рассказывали некоторое время тому назад. В то же время попытка использовать эту машину для поиска на иностранных языках принесет одно разочарование. Все-таки кластерные алгоритмы – одна из главных фишек «Нигмы», сильно привязаны к особенностям определенного языка, в данном случае – русского. Нужны зарубежные решения.
Предложений довольно много. Среди них есть и заслуженные ветераны, которые все еще работают, хотя предлагают возможности несколько архаичные для второго десятилетия двадцать первого века. Есть и относительно свежие проекты с инновационными находками. Пожалуй, самые продвинутые зарубежные кластерные метапоисковики – это системы PolyMeta и Yippy. Они демонстрируют различные подходы к поиску. PolyMeta полагается на объединение в одном интерфейсе выдачи крупных машин, а Yippy делает ставку исключительно на машины второго эшелона, потенциально способные блеснуть неизбитыми ссылками.
PolyMeta (www.polymeta.com) взаимодействует с полным комплектом крупнейших западных поисковиков: Google, Yahoo, Bing и Ask. Кроме того, обрабатывается выдача, полученная от амбициозного европейского проекта Exalead и относительно малоизвестного в наших краях поисковика Blekko. Список, как видим, сбалансированный. С одной стороны, мы не теряем результаты поисковых гигантов, с другой – получаем свеженькие варианты из оригинальных баз проектов второго эшелона. Набор поисковиков, на которые будут отправляться запросы, можно настраивать, так что при желании PolyMeta можно использовать как своеобразный кластерный интерфейс к какому-либо из поддерживаемых поисковиков.
Кроме поиска сайтов предлагаются стандартные варианты специализированного поиска по новостям, мультимедиа-контенту и блогам. Принципиальный подход разработчиков – ориентация на относительно небольшое количество результатов при повышенном внимании к их качеству. «Относительно небольшое» — это не просто красивая фигура речи: фильтрация здесь работает серьёзная.
В результате стандартная выдача PolyMeta по запросу – немногим более пяти десятков ссылок, отобранных из результатов задействованных источников. Эти ссылки распределяются по кластерам, причем PolyMeta не пытается поразить их количеством, достаточно аккуратно выделяя максимум десяток-полтора вариантов и представляя их в иерархическом порядке. Кластеризация результатов работает в базах веб-поиска, новостях и блогах.
Оригинальный режим демонстрации кластеров называется Topic Graph. Работает он на Java и соответственно требует наличия виртуальной машины. В этом режиме кластеры показываются наглядной схемой-деревом. Карта перестраивается в зависимости от того, какой узел выбран в конкретный момент. По умолчанию карта выводится в отдельном окне, но командой dock ее можно закрепить непосредственно на странице выдачи вместо стандартной панели со списком кластеров.
Результаты поиска хорошие. Выдача действительно отличается от «гугловской», периодически демонстрируя любопытные альтернативные ресурсы. Кластерная система хорошо разбирает запросы на основных европейских языках. Понимает она и русский, кластеры получаются адекватными, но до Nigma ей в данном случае все-таки далеко.
Страница выдачи достаточно насыщенная, в глазах немного рябит от «фейсбуковских» кнопочек и виджетов. Если говорить о полезных панелях, то справа выводятся блоки результатов поиска во всех вертикальных базах PolyMeta, что достаточно удобно. Поскольку количество ссылок в выдаче невелико, действует вся эта механика довольно шустро. Доступен режим предварительного просмотра найденных сайтов непосредственно на странице выдачи PolyMeta.
Yippy (yippy.com) – довольно заслуженный, если можно так сказать, проект – ему уже идет тринадцатый год. Базовая технология этого метапоисковика была разработана как академический проект в области сортировки больших массивов данных. Затем разработчики организовали компанию Vivisimo, которая торговала этим алгоритмом и держала для демонстрационных целей собственный одноименный метапоисковик. После прямого выхода на рынок именно интернет-поиска, проект стал называться Clusty. От всё еще работавшего параллельно поисковика Vivisimo он отличался только деталями дизайна. Компания Yippy несколько лет тому назад приобрела Clusty. Таким образом, современный Yippy – прямой наследник Clusty в части обработки информации, дополненный рядом новых баз и сервисов.
К метапоисковикам обычно обращаются, когда результаты крупных машин не приносят нужных данных. Тем интересней метапоисковики, работающие с относительно малоизвестными поисковыми ресурсами. Мало кто из альтернативщиков способен напрямую тягаться с тем же Google. А вот коллекция результатов таких поисковых «малышей» уже представляет практический интерес, все-таки лидеры поискового рынка иногда чересчур увлекаются фильтрацией и оптимизацией результатов и в такой сводной базе реально найти что-нибудь необычное и интересное, пропущенное роботами «больших парней».
Yippy опрашивает несколько систем, как с открытыми базами, так и с коммерческим доступом. Прямого полного списка источников не приводится, но проанализировав выдачу можно сказать, что в основе это Ask, Gigablast, активно используется OpenDirectory, а также некоторые индексные базы с коммерческим доступом. Кроме того, Yippy постепенно собирает и собственную базу. В результате такой набор источников как раз хорош для того, чтобы увидеть альтернативу лидерам рынка поиска.
Как и в PolyMeta, здесь сделана ставка на отбор в предлагаемую пользователю выдачу только относительно небольшого количества ссылок. Здесь, правда, все не так радикально, как у предыдущего участника нашего обзора и выдача, как правило, состоит из нескольких сотен ссылок.
Здесь также применяются технологии кластеризации результатов. Результаты работы этого алгоритма выводятся в боковой панели. По умолчанию она содержит четыре закладки. Clouds – это собственно перечень выявленных кластеров. Подсчитываться он может несколькими способами, переключаться между которыми можно кнопкой Remix. Есть своеобразный «поиск в найденном» — поле, с помощью которого можно найти и подсветить все кластеры, в которых встречается какое-либо дополнительное ключевое слово.
Остальные вкладки боковой панели позволяют отсортировать выдачу по формальным признакам: источникам, в которых они были найдены, сгруппировать по доменам и хронологическому признаку. На странице результатов рядом с каждой ссылкой есть кнопки, открывающие предварительный просмотр найденной страницы непосредственно на странице поисковой выдачи. Также есть возможность выделить в списке боковой панели все кластеры, в которых упоминается данная страница.
Кроме веб-поиска Yippy предлагает поиск по ряду вертикальных баз. Набор баз, ссылки на которые можно увидеть сразу рядом с полем поиска настраивается в опциях поисковика. Помимо стандартных по своим возможностям баз новостей, картинок и блогов здесь есть и доступ к достаточно забавному в эксплуатации кластерному интерфейсу поиска по Википедии. Мобильных приложений у Yippy пока нет, но присутствуют оптимизированные версии веб-поиска. Версии Tablet и Mobile отличаются дизайном и составом инструментов.
В целом результаты у Yippy достойные. Англоязычные запросы хорошо разбираются кластерным алгоритмом, который к тому же сразу сортирует их в виде иерархической структуры. Демонстрация только относительно небольшого количества лучших ссылок, полученных от внешних источников, как и в случае PolyMeta – ход неоднозначный, что несколько снижает ценность данных машин для совсем уж глубоких раскопок. Как бы то ни было, подборки ссылок по одинаковым запросам действительно серьезно отличаются от выдачи того же Google, что частенько позволяет по-новому взглянуть на знакомые темы в интернете, что, собственно, и стоило ожидать от данного метапоисковика.
Любопытна тенденция: современные зарубежные кластерные метапоисковики четко ориентированы на отбор небольшого количества лучших ссылок из задействованных источников. В результате они хороши для первоначального знакомства с той или иной темой с точки зрения сразу нескольких поисковиков – к нашим услугам будет удобная сортировка и различные вспомогательные инструменты. В то же время это ограничивает их возможности по работе с «длинным хвостом» результатов поиска. Таким образом, они во многом призваны играть роль своеобразных рекомендательных машин, а не инструментов глубокого анализа «скрытого веба».
19.08.2013

Опубликовано: Upgrade Digital № 633

http://www.upweek.ru/klasternye-metapoiskoviki-polymeta-i-yippy.html

Фактографический интернет-поиск

«Ты не мудри, ты пальцем покажи!» - говорил чукче капитан из старого анекдота. Иногда нечто подобное хочется произнести и в ходе интернет-поиска. Целью большого количества запросов является получения прямых ответов на интересующие нас вопросы.
Классическая схема интернет-поиска предусматривала выдачу ссылок на сайты с соответствующей информацией. Чтобы до нее добраться приходилось делать лишний шаг и искать ее затем в тексте веб-страницы, что не очень рационально. Куда эффективней распознать такой прямой запрос и сразу же дать на него пользователю требуемый ответ непосредственно в выдаче поисковика. Другими словами – провести фактографический поиск. Это заметно экономит время, поэтому современные поисковики активно обзаводятся соответствующими инструментами. Для использования поиска не обязательно искать специализированные системы, достаточно знать и пользоваться соответствующими функциями двух самых популярных в наших краях универсальных поисковиков.

Читать полностью: Upgrade Digital № 631

Гуглим со вкусом

Давным-давно, правда, в нашей галактике, создатели поисковиков выбирали между светом и тьмой, пардон, между двумя главными моделями совершенствования поиска. И в те дни и сейчас массовый, народный, поисковый запрос состоит из
одного-двух слов. Основная проблема работы с такими запросами состоит в их уточнении. Поди, разбери, что имелось в виду под запросом «окна»: покупки для ремонта или стройки, компоненты приложений или подборка баек из жизни айтишников? Первый, и, казалось бы, лучший вариант – это напрямую поинтересоваться у пользователя: «Чего тебе, мил человек, конкретно надобно?». Другими словами, предоставить режим расширенного поиска с хорошим набором
инструментов уточнения запроса, фильтрами или даже языком запросов со своим собственным набором команд-тегов. Потенциально такой способ может быть очень точным, однако у него есть свой недостаток: он требует от пользователя знакомства с предлагаемыми инструментами и определенной склонности к самообучению. Второй вариант – попытаться угадать информационные потребности пользователя. Никакой фантастики, обычная статистика, просто предварительно нужно собрать как можно больше информации о каждом конкретном человеке и его интересах.

Читать полностью: Upgrade Digital №612

понедельник, 19 ноября 2012 г.

Реверсивный поиск изображений в Сети

Контентный поиск изображений и его разновидность, реверсивный поиск, заметно отличаются от «традиционного». В обычном режиме мы составляем запрос из ключевых слов и получаем список изображений. Реверсивный поиск работает в обратном порядке.

В качестве запроса используется картинка, а система выдает список похожих на нее по какому-либо признаку изображений либо иную полезную информацию. К настоящему моменту сложилось несколько основных способов реверсивного поиска изображений. Первое направление – поиск по образцу, на точное совпадение.
Это означает, что система принимает в качестве запроса представленную пользователем картинку, после чего ищет в своей индексной базе веб-страницы, на которых встречается именно это изображение либо визуально похожие на него. Второй способ не требует от пользователя предъявления образца. Вместо этого предлагается самостоятельно сделать рисунок-набросок нужной картинки или же вручную указать требуемые параметры, например цветовую гамму.
Заметим, что крупные универсальные поисковики уже давно предлагают фильтры, учитывающие различные параметры изображений – размер, преобладающий цвет, – а также умеют распознавать портреты. Однако эти фильтры позволяют только уточнить запрос в пределах найденного подмножества. Данные инструменты нельзя было использовать для составления самого запроса.
Каким же образом можно использовать реверсивные поисковики на практике? Эти системы помогают решить три основные задачи. Первая – найти источник изображения. Предложив какую-либо картинку системе, мы получим ссылку на веб-страницу, на которой она была размещена. Полезно? Еще бы! Вторая задача – нахождение модифицированных версий представленной картинки, ее включений в коллажи, а также поиск изображений по их фрагментам. Третья задача – нахождение нужной картинки в версиях с более высоким разрешением и качеством.

Поиск по образцу
Относительно недавно инструменты реверсивного поиска были добавлены в базу поиска картинок Google. Вряд ли будет большой ошибкой предположить, что для многих пользователей именно эта новинка «большого G» стала открытием самой технологии реверсивного поиска картинок.
Реверсивный запрос к Google можно составить одним из трех способов. Первый – перетаскивание изображения-образца прямо в поле поиска Google. Поддерживается как drag & drop файлов из папок локального компьютера, так и перетаскивание картинок с других открытых веб-страниц. Второй вариант – вставить URL изображения в строку поиска. Наконец, можно воспользоваться формой загрузки файла с локального компьютера.
Явных ограничений на размер файла нет – система спокойно принимает картинки-запросы размером в несколько мегабайт, что вполне достаточно для подавляющего большинства ситуаций. Поиск начинается немедленно, а миниатюра картинки, которую мы использовали в качестве запроса, остается в строке поиска.
Страница результатов состоит из нескольких разделов. Если система смогла опознать изображенный на картинке объект, над общим списком выдачи появится небольшой блок с лучшими результатами текстового веб-поиска. В раздел «Страницы с подходящими изображениями» попадают одинаковые с вашим запросом или же очень похожие картинки, найденные в различных источниках, ссылки на которые приводятся рядом с миниатюрами.
Раздел «Похожие изображения» предлагает перечень визуально подобных изображений. Следует отметить, что система обращает внимание на цветовую гамму и расположение основных объектов. Распознавания не происходит, поэтому тематика картинок может быть самой разной. Однако Google предлагает для решения этой задачи другой инструмент: добавление к запросу-картинке привычных ключевых слов. Эта комбинация реверсивного и текстового поиска весьма удачна и действительно улучшает качество результатов. Дальнейшая работа с найденным контентом мало чем отличается от стандартного поиска картинок Google.

Сервис Google объединил возможности реверсивного и традиционного поиска

В качестве дополнительных инструментов предлагаются плагины для браузеров Firefox и Chrome. Функциональные возможности у них одинаковые: в контекстное меню браузера добавляется новый пункт, который отправляет URL заинтересовавшей вас в ходе серфинга картинки на реверсивную машину Google. Это, безусловно, полезные инструменты. К сожалению, у них есть и определенные недостатки.
Дополнение для Firefox не поддерживает последнюю на сегодня версию браузера, поэтому, чтобы запустить его, придется вручную поправить настроечный файл в XPI-пакете. Есть вопросы и к Chrome-версии. Дело в том, что данное расширение содержит NPAPI-плагин. Это означает, что оно может обращаться не только к ресурсам браузера, но и к ресурсам компьютера, например, свободно читать пользовательские файлы. В принципе, потребность в таких разрешениях понятна, однако даже по шкале родного интернет-магазина Chrome это считается высоким уровнем риска для приватности.
Как бы то ни было, реверсивный поиск Google является вполне зрелым и весьма полезным инструментом, который можно уверенно рекомендовать к постоянному использованию.
Google – не первая компания, предложившая открытый универсальный реверсивный поиск изображений. До запуска гугловского проекта лидерами в этой области были, пожалуй, онлайновые сервисы канадской компании Idee. Базовая технология данной службы – поисковая машина Piximilar, на базе которой и разрабатываются конкретные продукты. Соответствующий API на коммерческих условиях предлагается и для сторонних проектов.

TinEye предлагает удобный интерфейс и удачные дополнения для браузеров

Самый проработанный и полезный для нас проект этой фирмы – реверсивный поисковик изображений TinEye (www.tineye.com). Сразу скажем: со своими задачами он справляется весьма и весьма достойно. Данная система давно и благополучно достигла «товарного» состояния и может с успехом использоваться в повседневной работе, предлагая достаточно качественные и иногда неожиданные результаты. Попробуйте, например, провести с ее помощью поиск по аватарам ваших друзей.
TinEye пользуется собственной индексной базой. На сегодняшний день в ней содержится немногим больше двух миллиардов изображений. В принципе, охват достаточно большой, и TinEye неплохо справляется с большинством запросов. В то же время он не работает с популярными фотохостингами, явно предпочитая «обычные» веб-страницы с иллюстрациями.
Запросом служат загруженные с компьютера картинки или же URL интересующих вас изображений. Если вы захотите сохранить ссылку с результатами поиска, например, чтобы поместить ее на своем блоге, понадобится зарегистрировать на TinEye собственный аккаунт. Если этого не сделать, то картинки-запросы автоматически удаляются через четыре дня после их загрузки.
Страница результатов поиска TinEye содержит список найденных картинок (по десять на страницу).
Для каждой приводится миниатюра, имя файла, размер и адрес исходной веб-страницы. Дополнительных фильтров, равно как и режима расширенного поиска, здесь нет, но результаты можно отсортировать по признаку лучшего совпадения или же по размеру найденных версий картинки. Клик по миниатюре открывает окно сравнения, где можно оценить качество поиска, переключаясь между загруженным файлом-запросом и найденным TinEye-изображением.
Очень удобными дополнительными инструментами являются плагины TinEye для Firefox и Chrome – после их установки в контекстном меню появляется опция Search Image on TinEye, которая и отправляет выбранную картинку на поисковик. При этом распознаются даже бэкграунды веб-страниц. К данной возможности быстро привыкаешь, и эти дополнения – твердые кандидаты в джентльменский набор дополнений любого активного серфера. Для других браузеров, в том числе Opera, IE и Safari, предлагается букмарклет.
Есть в арсенале TinEye и виджет, который выводит на сайте или блоге вариации какого-либо изображения. Разработчики предлагают выбирать из нескольких знаменитых картин. Это сугубо развлекательный инструмент, не предлагающий каких-либо поисковых возможностей.
Кроме таких универсальных инструментов, как TinEye, на просторах Сети можно найти ряд тематических проектов, эксплуатирующих технологии реверсивного поиска. Начнем с проекта под незамысловатым названием Multi-service Image Search (iqdb.hanyuu.net). Этот поисковик работает с ресурсами, посвященными аниме, манге, гейм-арту и близким темам – всего обрабатывается восемь сайтов. Пусть охват и невелик, устройство поисковика имеет несколько любопытных особенностей.
По качеству инструментов составления запросов лидирует Google. В то же время TinEye умеет группировать одинаковые файлы и предлагает удобный инструмент сравнения картинок.
Начнем с того, что интерфейс Multi-service Image Search – проще некуда. Нам предлагается отметить чекбоксы ресурсов, на которые уйдет запрос, да ответить на вопрос о включении механизма оценки цветовой гаммы. Собственно, именно в нем и заключается изюминка системы. Ресурс действительно исправно поставляет результаты со схожей цветовой гаммой. Любопытно, что степень совпадения указывается в процентах рядом с каждой найденной миниатюрой и служит основой ранжирования найденного.
Среди реверсивных поисковиков нашлось место и частному проекту. SauceNAO (saucenao.com) также ориентирован на аниме- / манга-контент. Работает он в основном с цветовой гаммой изображений и частично с силуэтами предметов. Качество поиска у него не самое высокое, однако полезной функцией является поиск видео по кадру-запросу.

Сервис BYO Image Search подбирает похожие картинки по цветовой гамме

Тестируем поиск по образцу
Поскольку лучшими универсальными машинами для реверсивного поиска изображений на сегодняшний день являются сервисы от Google и TinEye, трудно избежать соблазна сравнить качество их работы и выявить наилучшие сферы применения этих замечательных инструментов. По качеству инструментов составления запросов лидирует Google. Его главный козырь – гибридный режим с уточнением визуального запроса с помощью ключевых слов. У TinEye ничего подобного нет – только чистый реверсивный поиск.
Если говорить о количественных параметрах, то размер индексной базы у Google явно побольше. При поиске по файлам из Сети сбоев с нулевым результатом поиска не было, проблемы в основном создавали только загруженные с локального компьютера тестовые снимки. Кроме того, в выдаче Google можно было увидеть результаты с некоторых крупных фотохостингов, например Photobucket. TinEye обходится индексированием «простых» веб-сайтов, да и надпись «0 results» в ходе тестирования встречалась немного чаще.
Что касается степени «похожести» предлагаемых результатов, то здесь позиции TinEye укрепляются. В частности, он немного лучше справляется с поиском изображений по фрагменту. Найденных файлов у Google гораздо больше, однако докопаться до вариантов какой-либо популярной картинки здесь сложнее – на первые позиции попадают «клоны».
Возможно, в данном случае подключаются и алгоритмы поиска по косвенным признакам, например извлеченным из текста веб-страниц ключевым словам. Справедливости ради заметим, что за счет более крупной базы Google выгодней использовать для поиска по фрагменту относительно редких изображений – алгоритм разбора запроса он отрабатывает на совесть, и шансы найти нужный результат довольно высоки.
Гугловская страница хорошо оптимизирована для показа большого количества результатов. В то же время TinEye умеет группировать одинаковые файлы и предлагает удобный инструмент сравнения картинок. В копилку данного сервиса отправится и наличие более удачных браузерных плагинов.
Поиск по характеристикам и наброску
На странице Idee Labs (labs.ideeinc.com) можно найти еще парочку любопытных инструментов, дополняющих TinEye и работающих по другим принципам. BYO Image Search предлагает поиск визуально похожих на продемонстрированное в качестве запроса изображений. Поиск ведется по базе фотостокового проекта Alamy (www.alamy.com) и затрагивает примерно 3 млн изображений.
В отличие от TinEye, здесь не ставится задача нахождения одинаковых изображений или их фрагментов, – это именно поиск картинок, просто похожих на исходную по цветовой гамме и очертаниям предметов. Запросом может служить загруженный с компьютера файл или же изображение, находящееся в Сети (по его URL). Поддерживаются форматы JPEG, GIF и PNG, максимальный размер файла – до 20 Мбайт.
Idee Multicolor Search Lab (labs.ideeinc.com/multicolr) предлагает найти изображение по сочетанию цветов. Запрос здесь составляется не с помощью предъявленного изображения, а вручную. Из палитры можно выбрать до пяти оттенков. Перетаскивая границы цветов на этой палитре, можно указывать их процентное соотношение на нужной картинке. Результаты поиска – 50 лучших совпадений – немедленно подгружаются на страницу. В качестве базы поиска в данном случае используется фотохостинг Flickr, точнее наиболее интересные изображения, представленные на нем под лицензией Creative Commons, общим числом 10 млн.

Idee Multicolor Search Lab ищет изображения по соотношению оттенков

Заметим, что такой способ поиска использовался ранее другими экспериментальными поисковиками. Например, с подобным интерфейсом, построенном на основе алгоритмов IBM, уже давно можно поработать на сайте Государственного Эрмитажа. В то же время Idee отличается действительно высоким качеством результатов, а также очень простым интерфейсом.
Следующий проект, Visual Search Lab (labs.ideeinc.com/visual#), комбинирует контентный поиск и теги. Кроме фотозапроса здесь выводится перечень тегов, которыми были отмечены найденные фотографии, что позволяет быстро фильтровать результаты не только по визуальной схожести, но и по тематике. К сожалению, это только демонстратор технологии, работающий с фотостоком Alamy и не дающий доступа к полноформатным фото.
Упомянем также, что Idee предлагает интересные коммерческие системы. PixID (ideeinc.com/products/pixid) предназначена для отслеживания использования фотографий и их фрагментов в печатных публикациях и элементах дизайнерского оформления, а платный сервис PixMatch (ideeinc.com/products/pixmatch) – для организации реверсивного поиска изображений как в Сети, так и по локальной базе картинок.
RevIMG предлагает два режима работы: по загруженному изображению и по наброску

Следующий герой нашего обзора, поисковик RevIMG (www.revimg.net), предлагает два режима работы: собственно реверсивный поиск по образцу загруженного пользователем изображения, а также режим рисования, когда юзер может попытаться самостоятельно нарисовать эскиз искомой картинки.
В отличие от Google и TinEye, данная система не пытается проиндексировать весь интернет, а сосредотачивается лишь на определенных тематических сегментах. Они перечислены в выпадающем меню на странице составления запроса. Всего предлагается пара десятков разнообразных категорий – от флагов стран мира до галерей некоторых известных художников, подборок снимков различных достопримечательностей, цветов, редких монет и многого другого.
Выбор категории является обязательным – без него поиск просто не начнется. На следующем этапе нам предлагают определить, будет ли запросом загруженное изображение целиком или же только отдельный его фрагмент. В последнем случае можно выделить на картинке нужную зону. Категории в списке выделяются различными цветами. Так, например, категории, основанные на поиске по какому-либо конкретному сайту, подсвечиваются белым, недавно обновленные – желтым.
На странице результатов показывается по пять найденных миниатюр. Для каждой приводится название найденной картинки, ссылка на содержащую ее веб-страницу, процент совпадения с картинкой-запросом. Рядом со всеми результатами есть кнопка поиска по имени файла в Google и Wikipedia. Кроме того, здесь есть кнопка, показывающая зоны совпадения изображения-запроса и найденной картинкой – такие зоны выделяются розовой подсветкой.
Система реверсивного поиска Retrievr работает с базами фотохостинга Flickr

Второй режим – поиск по скетчу – работает только в браузере Internet Explorer. В этом режиме пользователю предлагается небольшой «холст», скромный набор кистей и свобода самовыражения – запрос можно просто нарисовать. Использование в качестве запроса сделанного пользователем наброска не является уникальной способностью RevIMG. Аналогичный режим можно увидеть на экспериментальном поисковике Retrievr (labs.systemone.at/retrievr), принадлежащем австрийской компании System One Labs. Данный ресурс работает с базой Flickr Interestingness.
Для рисования применяется специальная Flash-панель. Она содержит небольшую рабочую область, где и предлагается рисовать графический запрос. Кроме того, на ней находится набор круглых кистей разного размера, а также палитра, с помощью которой выбираются нужные оттенки. Анализ рисунка происходит практически в режиме реального времени. Прямо в ходе рисования на страницу подгружаются результаты поиска, что позволяет немедленно корректировать свой набросок.
Результаты такого поиска пока неоднозначны. Простейшая «рожица» исправно выдает галерею портретов, белый круг на черном фоне – фотоснимки Луны. В то же время попытки изобразить деревце или еще что-нибудь более детальное пока ведут к порядочному разброду. Для получения хорошего результата стоит рисовать крупными мазками и не пытаться изображать мелкие детали, работая с общим колоритом.
Компанию сервисам RevImg и Retrievr может составить проект Anaktisi (orpheus.ee.duth.gr/anaktisi), который также обладает режимом поиска по наброску. Правда, он находится в стадии бета-версии и грешит заметными неточностями в поиске. Поэтому его стоит воспринимать скорее как демонстратор технологий, а не практический инструмент. В то же время он не привязан только к Flickr, позволяет выбирать базу поиска из предлагаемого списка, а также дает возможность задействовать несколько интересных фильтров результатов.

Алексей Кутовенко
Опубликовано: Upgrade

пятница, 16 ноября 2012 г.

Поиск персональной информации


Обзор посвящен интернет-поисковикам, предназначенным для розыска информации о пользователях Сети. Они помогут установить личность человека, с которым вы встретились в интернете, навести справки о знакомых или же провести поиск по собственному имени. Многие пользователи зачастую не отдают себе отчета в том, что, если собрать воедино те фрагменты данных о них, которые они оставляют на разных ресурсах, такой сводный «профиль» будет содержать куда больше информации, чем они бы решились сообщить одному веб-сервису.

Анализируем открытые источники

Начиная рассказ о средствах поиска персональной информации, нельзя пройти мимо возможностей универсальных поисковиков, которые с относительно недавнего времени научились индексировать открытые страницы пользователей крупнейших социальных сетей. В то же время для такого поиска характерен ряд ограничений. Один из нюансов работы универсальных поисковиков – ориентация на рейтинг проиндексированных веб-страниц при формировании списка результатов.
«Пресс-портреты» «Яндекса» – это своеобразный справочник о встречающихся в новостях персоналиях

Это означает, что при персональном поиске на первых позициях будут популярные сетевые публикации, подписанные указанным именем. В лучшем случае мы увидим ссылки на первые страницы профилей некоторых социальных ресурсов, на которых зарегистрированы люди с таким именем. В то же время установить отдельные факты о человеке либо его связях с другими лицами или событиями довольно сложно.
Немного дальше пошел «Яндекс», запустивший в своем новостном разделе оригинальный сервис «Пресс-портреты» (news.yandex.ru/people). Это своеобразный справочник о встречающихся в новостях персоналиях. Для каждой персоны приводится настоящее досье, состоящее из нескольких разделов. Первый бесхитростно назван «Кто это» и содержит перечень ключевых слов, которые характеризуют героя досье. Для каждого такого слова приводится количество упоминаний в СМИ, а также ссылки.
Названия разделов «Работа», «Новости» и «Интервью» говорят сами за себя: там вы найдете именно названные сведения о данной персоне. Весьма полезна функция «Связанные пресс-портреты». Раздел содержит ссылки на пресс-портреты других людей, которые часто упоминаются вместе с именем героя изначального поиска.
Ресурс PeekYou (www.peekyou.com) обладает базой, содержащей порядка 250 млн персональных «досье», полученных индексированием различных открытых источников: блог-платформ, медиахостингов, социальных сетей и других подобных ресурсов. PeekYou работает с открытым, «видимым» вебом, индексируя Twitter, LinkedIn и еще парочку подобных источников. К сожалению, он не взаимодействует с нашими популярными социальными ресурсами.
Интерфейс поиска и списка результатов у PeekYou устроен достаточно понятно. На стартовой странице предлагается указать имя, фамилию или ник интересующего вас человека. К сожалению, ники обрабатываются гораздо хуже, чем «нормальные» имена. Сразу же можно уточнить страну поиска, а для США еще и штат.
Система PeekYou ориентируется на открытые веб-источники и представляет результаты в удобном интерфейсе

Все остальные инструменты уточнения запроса собраны на боковой панели страницы. Это пол, возраст, который задается с помощью ползунка, а также тематические теги. Собственно список результатов разделяется на блоки по типам источников: профили на сайтах, мультимедиахостингах и ряд других. Выбрав подходящий результат, можно открыть страничку персонального «досье», на которой вся найденная фактическая информация будет представлена в легком для восприятия, структурированном виде.
Для ранжирования и оценки результатов на данном ресурсе используется собственный индекс PeekScore. Измеряется он в диапазоне от единицы до десяти и рассчитывается для каждого «досье». Чем выше PeekScore, тем более заметной и активной является данная персона в Сети.
Учитываются посты на блогах, количество аккаунтов на социальных ресурсах, упоминания во внешних источниках и другие подобные факторы. Высокий индекс также косвенно свидетельствует о большей достоверности приведенных результатов поиска, поскольку при извлечении и анализе данных системе было доступно больше источников. Кроме того, ориентируясь на PeekScore, можно вычислять экспертов или просто активных авторов в той или иной тематической сфере.
Интернет-сервис CVGadget делает главную ставку на быстрый поиск по открытым веб-источникам

Еще один проект, делающий ставку на удобный анализ открытых источников, – CVGadget (www.cvgadget.com). Устроен он весьма просто: заданный запрос отправляется на поддерживаемые источники, после чего результаты демонстрируются на одной странице. Обрабатываются 14 проектов, среди которых Facebook, MySpace и LinkedIn, а также линейка сервисов Google – от блогов до «Документов». Для каждого блока показывается общее количество найденных совпадений. Сами ссылки можно увидеть в раскрывающемся списке. Надо сказать, такой подход заметно ускоряет работу с ресурсом, да и результаты поиска довольно приличные.
Работаем со «скрытым вебом»
Наглядное представление информации из открытых источников – это, конечно, замечательно, однако позволяет решить только ограниченный круг задач. Ряд современных поисковиков, ориентированных на операции с персональными данными, обращаются к тому, что принято называть «deep web», – имеющейся в Сети информации, которая в силу разных причин ускользает от роботов-индексаторов обычных, универсальных поисковиков.
Как правило, это различные базы данных, не размещаемые напрямую на веб-страницах. Роботы таких систем пытаются взаимодействовать с подобными базами, проводить поиски, извлекая полезную инфу – контактные данные, факты, сведения о других опубликованных данных. Именно к «скрытому вебу» относятся базы профилей пользователей различных ресурсов и другие источники информации о людях, а также данных, позволяющих связать опубликованную в Сети информацию с определенной персоной.
В этой связи нельзя не упомянуть сервис Wink (wink.com). Дело в том, что его создатели называют Wink крупнейшей открытой базой персональной информации в интернете, заявляя о том, что их система проиндексировала к настоящему времени более 400 млн профилей на самых различных сетевых ресурсах.
Форма составления запроса Wink достаточно проста и предлагает отличный набор дополнительных фильтров, сгруппированных в тематические блоки, расположенные под строкой запроса. С их помощью можно отфильтровать данные по полу и возрасту, указать возможные интересы, местоположение и другие дополнительные сведения, позволяющие уточнить результаты поиска. Возможен также реверсивный поиск по адресу электронной почты.
Несмотря на впечатляющие объемы базы, в наших широтах Wink имеет ограниченную полезность, поскольку он не только не работает с наиболее популярными у нас социальными ресурсами, но и не воспринимает запросы, набранные кириллицей. Так что сфера его применения для нас – поиск информации о зарубежных контактах. Кроме того, во многих случаях Wink получает данные от своих партнеров, в частности сервиса MyLife, а там для просмотра результатов поиска требуется регистрировать платный аккаунт. В то же время действительно большая база Wink пригодится при первоначальном сборе информации.
Следующий проект нашего обзора вовсю эксплуатирует образ всезнающих чекистов. kgbpeople (www.kgbpeople.ru) позиционируется как средство поиска сведений о людях, размещенных в социальных сетях и на других интернет-источниках. Кроме того, создатели kgbpeople предлагают находить некорректные сведения о себе и, соответственно, принимать те или иные меры для исправления ситуации. Можно также включить оповещение о новой информации, связанной с вашим именем, которая попадает в индексные базы проекта.
В качестве запроса принимается имя или ник интересующего вас человека. Далее система действует как классический метапоисковик: проводит поиск по доступным базам различных внешних проектов, затем обрабатывает результаты и демонстрирует их единым списком.
Ряд современных поисковиков, ориентированных на операции с персональными данными, обращаются к тому, что принято называть «deep web».
Выбрать ресурсы, по которым ведется поиск, можно на странице настроек («Параметры поиска»). Выбор, надо сказать, неплохой. Предлагается больше двух десятков социальных сетей, причем не только общеизвестных Facebook, Twitter или LinkedIn, но и достаточно неизбитых: здесь представлены, например, французские и голландские социальные сети, а также музыкальный рекомендательный сервис Last.fm. Кроме того, доступен список крупных универсальных интернет-поисковиков, а также медиахостингов. Это позитивно сказывается на широте поиска. Фильтр имеется только один: географический. При необходимости можно ограничить сферу деятельности kgbpeople определенной страной.
Ресурс kgbpeople предлагает метапоиск по весьма значительному количеству социальных ресурсов

Страница результатов kgbpeople состоит из нескольких вкладок. Первая, «Виртуальные сообщества», содержит список панелей, соответствующих задействованным в поиске ресурсам. По умолчанию выводятся только панели тех ресурсов, на которых были найдены какие-то полезные сведения. Другие панели предлагают доступ к результатам универсальных поисковиков, выдаче популярных медиахостингов.
Вкладка «Личные» носит вспомогательный характер: сюда, например, попадают теги, которые нашлись в описаниях, аккаунтах и других материалах. Этот инструмент позволяет быстро уточнить свой запрос, что полезно, в частности, при большом количестве обнаруженных однофамильцев.
На сайте предусмотрена бесплатная регистрация. Она, в принципе, необязательна, но позволит создать свою страничку с персональными данными, которые будут использоваться поисковиком, сохранять поисковые запросы, что весьма удобно при устойчивых интересах. Кроме того, появятся дополнительные инструменты анализа данных, например статистика поисков по вашему имени. kgbpeople также умеет рассчитывать так называемый WOW-фактор, который отражает общее количество связей конкретного человека с другими в социальных сетях и на других подобных ресурсах.
Для работы этого инструмента, правда, придется предоставить приложению доступ к вашим собственным аккаунтам в нужных социальных сетях. Поскольку при этом открывается доступ к приватной информации, приходится внимательно взвешивать возможности и потенциальные риски. Справедливости ради заметим, что подключение своих учетных записей действительно благоприятно сказывается на полноте и точности получаемых с помощью kgbpeople результатов.
Теперь о недостатках. В результатах поиска kgbpeople довольно много информационного шума. Система не всегда корректно обрабатывает пару «имя-фамилия», в результате чего нужные данные приходится иногда буквально выкапывать. Есть проблемы и с полнотой индексирования: например, система «не видит» недавно зарегистрированные аккаунты, что говорит о невысокой скорости индексирующих роботов. Еще один важный для нас недостаток – отсутствие поддержки популярных российских социальных проектов. Смутить может и попытка сбора персональных данных при регистрации аккаунта.
Поисковая система Pipl (pipl.com) также пытается связать данные, полученные из различных источников, с конкретной персоной и представить их в более-менее организованном виде.

Pipl применяет собственные алгоритмы ранжирования. «Вес» найденных данных определяется в отрыве от конкретных страниц и источников, из которых они извлекаются.
Соответственно, и «улов» ближе к фактографическому: даты, записи профилей, адреса – все это оценивается применительно именно к характеристике персоны. Досье может содержать сведения о возрасте, предполагаемом географическом местоположении, аватар, а также короткие выдержки из найденных профилей. В принципе, подобной информации обычно бывает достаточно, чтобы вычислить интересующего вас человека.
В качестве поискового запроса можно вводить как реальное имя, так и ник – ориентируйтесь на то, что, по вашему мнению, может быть использовано человеком в Сети. Есть у Pipl и форма расширенного поиска. В ней можно точно указать в отдельных полях все известные вам сведения о нужном человеке: имя, фамилию, ник, адрес e-mail, что позволит Pipl уточнить и ваш запрос, и, возможно, свои сведения о данной персоне. Кроме того, на боковой панели предлагается ряд фильтров, позволяющих уточнить запрос по возрасту, тегам или географическому признаку. Это весьма полезно, если вы ведете поиск только по нику и количество результатов слишком велико.
Первая страница выдачи содержит ссылки на «профили» – своеобразные автоматически сгенерированные досье, которые, возможно, относятся к человеку, которого вы ищете. Отдельные досье, например, составляются на ники, встречавшиеся вместе с именем из вашего запроса. Уточняющие ссылки, всплывающие при наведении курсора на профиль, – спонсорские, они направляют вас на внешние ресурсы и на них можно не обращать внимания. А вот клик по «профилю» приведет нас на следующую страницу списка результатов самого Pipl.
На ней приведены линки на проиндексированные ресурсы, которые, возможно, относятся к данной персоне. При желании вы можете помочь Pipl в его работе, отметив точные результаты с помощью кнопки Add to Profile. К сожалению, Pipl плохо понимает кириллические запросы, а также не индексирует наши социальные ресурсы.
В отличие от рассмотренных выше поисковиков, Spokeo (www.spokeo.com) не ставит задачу нахождения всех упоминаний человека в Сети. Его создатели вместо этого предлагают своеобразный гибрид поискового и мониторингового сервиса: вы указываете людей, а Spokeo пытается отследить все связанные с ними обновления на сетевых ресурсах. Другими словами, вам предлагается самостоятельно «сдать» системе персональную информацию о своих контактах, например импортировав адресную книгу своего почтового клиента.
Нельзя не напомнить, что и с вами могут поступить аналогичным образом. Spokeo также обрабатывает основные блог-платформы, крупные зарубежные социальные сети, а также ряд медиахостингов и рекомендательных сервисов. В результате вы получаете обзор сетевой активности интересующего вас человека на всех этих ресурсах. Spokeo пытается сгенерировать собственное «досье» на каждого отслеживаемого человека. В нем могут находиться достаточно чувствительные персональные данные, извлеченные из профилей отслеживаемых сервисов.
Spokeo предназначен для поиска и отслеживания человека на шести десятках крупных ресурсов

В качестве запросов Spokeo принимает не только имена или ники, но и адреса e-mail, а также номера телефонов (для некоторых стран). Интерфейс у сайта интуитивно понятный. Все обработанные ресурсы разделены на группы: «социальные сети», «сайты знакомств», «видеохостинги» и другие – всего десяток групп и 60 используемых ресурсов. Сразу следует оговориться, что в основном представлены популярные зарубежные сайты, так что для поиска информации о ближних соседях будут полезны разве что агрегированные результаты с таких сервисов, как Facebook, Twitter, LiveJournal, YouTube, Photobucket. Кроме того, Spokeo ведет поиск доменов, совпадающих с именем или ником из запроса.
Если в какой-либо из групп было найдено совпадение с вашим запросом, иконка соответствующего ресурса будет подсвечена. Поскольку Spokeo предлагает платную подписку на свои услуги, ряд сайтов в результатах поиска в бесплатной версии системы заблокированы. Как бы то ни было, мы действительно получаем массу полезной информации о персональной активности человека на одной странице.
Пару слов о качестве поиска. Несмотря на то что просмотр полных результатов здесь доступен только после регистрации платного аккаунта, Spokeo может сослужить добрую службу и в бесплатной ипостаси. Тестовые запросы показали, что поисковик вполне справляется с отслеживанием различных медиахостингов, неплохо разбирается с различными рекомендательными сервисами, а также, что бывает весьма полезно, хорошо ищет информацию об участниках аукционов на eBay. В то же время Spokeo пропускает профили Facebook и не всегда находит блоги LiveJournal.
Среди современных социальных сетей можно найти немало специализированных ресурсов, призванных объединять не просто всех желающих, но определенные группы пользователей, например по профессиональному признаку. Аналогичное разделение сфер начинает проявляться и в нише поисковиков персональной информации.
Удачным примером здесь будет бесплатный сервис Zoominfo (www.zoominfo.com), ориентированный на поиск информации о специалистах и потенциальных деловых партнерах. Источников пополнения у данного проекта несколько. Кроме индексирования сетевых ресурсов и получения информации от проектов-партнеров практикуется и прямое получение данных от пользователей.
Поисковик Zoominfo ориентирован на поиск сознательно опубликованной деловой информации

На сервисе предусмотрена бесплатная регистрация. В ходе нее вам предложат скачать и установить дополнение для Outlook, которое предназначено для анализа переписки пользователя. В ходе этого анализа программа пытается автоматически выделять имена, адреса, названия фирм, должности, ссылки на корпоративные веб-сайты и социальные сети, а также другую подобную информацию.
Взамен пользователь получает доступ к полной базе данных Zoominfo, в которой содержится примерно 50 млн персональных «досье» и 5 млн профилей фирм. Насколько это равнозначный обмен, решать вам. Упомянем только, что разработчики Zoominfo предусмотрели возможность удаления собственных данных из их каталога по запросу пользователя.

Алексей Кутовенко
Опубликовано: Upgrade

четверг, 15 ноября 2012 г.

Поиск музыкального видео в интернете

Музыкальные ролики уже перестали быть приложением к творчеству того или иного исполнителя или группы. Многие работы такого жанра можно рассматривать как самостоятельные произведения искусства. Современная Сеть предлагает немало возможностей их поиска. Заметим, что поиск видеоклипов характеризуется рядом особенностей. Прежде всего «ищущие» обращаются за помощью к универсальным поисковикам и видеохостингам. Конечно, немало подобного контента можно найти и с помощью простого поиска по архивам того же YouTube. Однако здесь нас будет поджидать немало подводных камней. Во-первых, музыкальный контент на универсальных видеохостингах специально не выделяется, что ведет к значительному шуму в результатах поиска.

Особенно это заметно, если не получается использовать точное название нужного ролика. Во-вторых, качество найденного видео может быть самым разным, в том числе достаточно низким. Иногда можно получить даже простую нарезку фотографий, наложенную на аудиодорожку. Кроме того, поскольку видеохостингов много, то, задействуя только какой-то один источник, пусть и самый крупный, мы все равно теряем определенный процент результатов. Решение данной проблемы известно – метапоиск. Действительно, при поиске можно не без успеха применять универсальные метапоисковики, обрабатывающие несколько видеохостингов. Одной из крупнейших таких систем является Truveo (ru.truveo.com). Данный ресурс не только индексирует несколько тысяч общедоступных порталов, но и приобретает лицензии на демонстрацию коммерческого контента непосредственно у правообладателей. Эти обстоятельства обеспечивают хороший охват поиска.
Truveo работает с тысячами источников, что обеспечивает хороший охват поиска
Что касается собственно возможностей составления и уточнения запроса, то Truveo предлагает в основном базовые функции. В поле ввода действует автодополнение ключевых слов, правда, работает оно только для английского языка. В то же время эта система не просто предлагает похожие слова, но и по мере возможностей выводит краткую справочную информацию о разыскиваемом объекте – это полезно при поиске исполнителей, у которых есть однофамильцы. Результаты можно просматривать в виде списка или набора графических миниатюр. Поддерживается сортировка по релевантности, дате добавления ролика в базу и количеству обращений. Для просмотра видео предлагается встроенный онлайновый плеер Truveo.
На странице выдачи расположена боковая панель, содержащая несколько блоков фильтров. Блок «Сайты» выводит список всех источников-видеохостингов, на которых были найдены результаты по запросу пользователя. Выбирая нужные чекбоксы, можно фильтровать результаты по источникам. В отличие от аналогичных фильтров на большинстве универсальных поисковиков, здесь можно одновременно выбрать несколько источников, не ограничивая поиск только каким-либо одним хостингом. Блок «Телепередачи» выводит список результатов, найденных в архивах лицензированного Truveo контента. Собственно музыкального видео здесь немного, однако иногда можно найти любопытные интервью и новостные сюжеты по нужной теме. Блок «Категории» по сути, является тематическим фильтром, который оперирует ключевыми словами, присвоенными найденным роликам на исходных видеохостингах.
Кроме универсальных по своей тематике видеохостингов в современной Сети можно найти большое количество специализированных сервисов для музыкального видео. Примером может служить RockTube (www.rocktube.us). Данный проект предназначен для размещения видео, так или иначе связанного с рок-культурой во всех ее многочисленных проявлениях. Подчеркнем, что это не метапоисковик, а самостоятельный видеохостинг, поэтому здесь можно найти уникальный контент. Доступен только режим простого поиска. Фильтры или опции сортировки результатов не предусмотрены. Все видео на проекте разделено на ряд тематических категорий. Video предназначена для клипов, Live – для записей «живых» выступлений. Отметим категорию YoungTalents, объединяющую «самиздат», а также GuitarZone, которая содержит только видеозаписи гитарных соло и обучающие ролики. К сожалению, система поиска функционирует только в разделе Video, остальные можно просматривать в режиме каталога.
Тематические сервисы, специализирующиеся на видеоклипах, можно найти и в Рунете. Пример такого проекта – сайт Zvezdi.ru. Задуманный в первую очередь как энциклопедия шоу-бизнеса, он может выступать и как поисковик клипов. База поиска – открытые видеохостинги, значительное количество из которых – русские. Собственно инструменты составления запроса здесь весьма просты: поддерживается только простой режим поиска и выбор сортировки найденного. В то же время результаты выдачи произведений русских исполнителей здесь достаточно полные и по качеству заметно выигрывают у конкурентов. Кроме системы поиска видео на сайте действует алфавитный каталог исполнителей. «Персональные странички» содержат краткую биографическую информацию, ссылки на тексты песен, MP3-файлы, фотоархив, а также список видеоклипов.
Достаточно редкая на сегодняшний день группа сервисов – специализированные метапоисковые системы, работающие только с музыкальным видео. Далее мы познакомимся c двумя наиболее интересными представителями этого класса. Начнем с проекта SearchMusicVideo (www.searchmusicvideo.com/video). Данный сервис прост и достаточно полезен. Точного списка поддерживаемых видеохостингов разработчики, к сожалению, не приводят, однако в результатах поиска можно встретить ролики с YouTube, Pitchfork, Dailymotion, Vimeo, MySpace и других крупных ресурсов. Интерфейс SearchMusicVideo выдержан в стиле функционального минимализма: только строка поиска, меню выбора способа сортировки обнаруженного да перечень последних запросов. Страница выдачи также ничем не отвлекает от просмотра собственно списка результатов. Каждый его пункт сопровождается кратким описанием, графической миниатюрой ролика, а также названием хостинга, на котором он был найден. Возможна сортировка результатов по релевантности, дате, популярности и среднему рейтингу. Кроме видео данная система может искать и по текстам песен.
Страница Cleepr содержит до четырех десятков лучших результатов поиска
Стартовая страница французского проекта Cleepr (www.cleepr.com) встречает посетителей облаком тегов, в котором перечисляются исполнители, наиболее популярные в обработанных за последнее время запросах пользователей системы. Базой поиска являются крупнейшие видеохостинги: YouTube, Dailymotion, MySpace, а также ряд проектов помельче. Доступен только режим простого поиска. Страница содержит миниатюры найденных видеоклипов, сопровождаемые минимумом дополнительных сведений: имя исполнителя, название композиции, ее рейтинг среди посетителей Cleepr и общее количество просмотров ролика. Любопытно, что список ограничивается только четырьмя десятками лучших результатов, которые выводятся одной страницей. При столь жестком подходе особое значение приобретает обработка. Надо сказать, что в большинстве случаев Cleepr с ней справляется неплохо: дублей практически не бывает, да и качество поиска достаточно хорошее.
Кроме списка выдачи на странице находится боковая панель. Она разделена на две зоны: Sources и Genres. Второй раздел, Genres, служит для нахождения похожих исполнителей. Здесь выводится набор жанров, тегами которых были помечены находящиеся в списке видеоклипы. Клики по ним открывают перечень видео других исполнителей, относящихся к близким жанрам. Данные разделы не являются фильтрами для уточнения запроса, как это может показаться на первый взгляд. Для исполнителей также приводятся краткие биографические сведения, полученные из «Википедии».
Для просмотра видеороликов не понадобится переходить на сайты-источники: Cleepr откроет собственное окно онлайнового мультимедиаплеера. Более того, все найденное видео может проигрываться единым плей-листом. На основе своего запроса можно создать RSS-канал оповещений. Cleepr предлагает собственный виджет, который можно разместить на своем блоге или персональной стартовой странице, например iGoogle или Netvibes. Существует и мобильная версия Cleepr (i.cleepr.com), адаптированная для взаимодействия с коммуникаторами и другими портативными гаджетами. Для современных интернет-браузеров имеется поисковый плагин в формате OpenSearch.

Алексей Кутовенко
Опубликовано: Upgrade

Новинки Nigma

С публикации нашего последнего материала о Nigma прошло уже немало времени. Надо заметить, разработчики не теряли его даром: на страницах лучшего российского кластерного поисковика появились масса новых сервисов и возможностей.

Начнем с изменений в пользовательском интерфейсе. Во-первых, появилась облегченная версия поиска. Такая веб-страница содержит только строку запроса и опции выбора вертикальных баз. А вот стандартная стартовая страница Nigma обзавелась набором «рюшечек» – прогнозом погоды и ссылками на популярные социальные сервисы и прочие «коллекции открыток».
Если это попытка создать индивидуализированный интерфейс в духе iGoogle, то невнятная и как-то совсем не в инновационном характере Nigma. В то же время размещение настроек поиска в виде выпадающих меню под строкой запроса действительно удобно. Теперь выбор поисковиков, на которые будет отправлен запрос, языка результатов и способа их сортировки происходит гораздо быстрее.
Автозаполнение запросов присутствовало в Nigma и раньше, однако сейчас в нем появляются и дополнительные данные: перевод вводимых слов на английский язык, короткие ответы на прямые вопросы к системе, а также справка из «Википедии» по теме поиска. Кроме того, по выпадающему меню автозаполнения теперь можно перемещаться с помощью клавиатуры, что улучшает эргономику. Вследствие проведенного тюнинга данное меню превратилось в самостоятельный и довольно мощный инструмент поиска.
Очень интересной функцией Nigma стал «Инфопоиск». Посмотреть на него можно на главной странице. При индексации веб-страницы разбиваются на блоки данных. Отдельные блоки интернет-страниц, относящиеся к вашему запросу, добавляются к результатам поиска с высоким рейтингом. В итоге на высоких позициях списка пользователь видит не только ссылки на максимально релевантные веб-страницы, но и часть содержимого менее релевантных страниц. Это оправданно: мы не теряем полезную информацию из «длинного хвоста» результатов и экономим время, которое иначе пришлось бы потратить на просмотр дополнительных веб-страниц.
Nigma также обзавелся мощной системой поиска ответов на конкретные вопросы, а также научился решать математические примеры и моделировать химические реакции – уникальное пока предложение среди универсальных поисковиков. Для некоторых типов задач (линейные, биквадратные, бикубические уравнения и другие) выводится не только ответ, но и ход решения. Кроме того, быстрые ответы на такие вопросы демонстрируются в меню автозаполнения.
Улучшилась работа с англоязычными запросами. В системе теперь действует инструмент «Англоподсказка», который подсказывает правильные грамматические конструкции для запросов на английском языке, подставляет в запрос синонимы, имеющие аналогичный русский перевод. Пока это экспериментальная функция, и ее возможности ограниченны.
Появились режимы табличного и музыкального поиска. Если ответы на запрос пользователя можно представить в структурированном виде, Nigma формирует на их основе таблицу и выводит ее над общим списком результатов. Это очень удобный режим представления данных, ценность которого повышает возможность сохранения таблицы в формате CSV.
К сожалению, эта экспериментальная функция пока ограничена только очень небольшим количеством запросов, кроме того, она несколько замедляет процесс поиска. Если для вашего запроса доступны таблицы, то на странице появится специальный значок.
Поиск музыки Nigma хорош тем, что при индексировании аудиофайлов информация извлекается из MP3-тегов, что позволило реализовать режим структурированной демонстрации результата. Сведения о файле представляются в виде таблицы.
Информация группируется по именам исполнителей, названиям альбомов и композиций, а также жанрам. Кроме того, на соответствующей панели выводится и текст песни, если таковой известен Nigma. В принципе, подобный режим поиска привычен по работе со всевозможными плеерами, поддерживающими создание библиотек мультимедиа, однако в сфере интернет-поиска, тем более универсального, это новинка, причем весьма полезная. Найденные записи можно прослушать прямо на странице результатов поиска – для этого предусмотрен встроенный плеер.
Nigma выдает прямые ссылки на файлы, а не отправляет юзера на исходный URL. Пользователи поисковика могут загрузить на сервер файлы в формате MP3, которые будут исправно проиндексированы и станут доступны для всех посетителей Nigma. Свои файлы впоследствии можно будет удалить.

Алексей Кутовенко
Опубликовано: Upgrade 

Поиск видео: сравниваем поисковики

Интернет-поиск видеофайлов, как и поиск изображений, можно вести различными путями. Значительная часть видеоконтента в современной Сети сохраняется на многочисленных видеохостингах, наиболее крупным и известным из которых остается YouTube.

Среди таких ресурсов можно найти и универсальные по своему содержанию, и тематические хранилища, например специализирующиеся на документальном и образовательном видео или же развлекательном контенте. Поскольку таких ресурсов достаточно много, возникает уже знакомая нам ситуация: если пользоваться только одним из них, неизбежны потери, поскольку не существует одного портала, содержащего все сетевое видео. Решение данной проблемы также известно: создание систем поиска, способных одновременно взаимодействовать с различными видеоресурсами.
Многие универсальные поисковики предлагают собственные вертикальные индексные базы видео. Как правило, они работают с принадлежащими поисковикам видеохостингами или же ищут по нескольким крупным видеоресурсам. Факт интеграции видеопоиска с другими инструментами «универсалов» способствует популярности такого способа поиска. Все-таки просто переключиться на другую вкладку для поиска видео гораздо быстрее, чем переходить на внешний видеопоисковик.
Возможности универсальных поисковиков по части изыскания видео довольно схожи, поэтому мы расскажем об их общих чертах, а также остановимся на различиях. Мы рассмотрим только несколько видеобаз таких «универсалов», пригодных для нахождения видео по запросам на русском языке. Это «Видео Google», «Яндекс.Видео», «Рамблер.Видео» и Bing Videos. Они выбраны за широкий охват источников и хорошие результаты поиска по русским видеофайлам. Это, конечно, не единственные универсальные сервисы, предлагающие поиск видео, однако именно они способны удовлетворить основной процент повседневных требований к такому роду задач.
«Видео Google»
Видеопоиск от Google (video.google.ru) в свое время стал пионером подобных сервисов на страницах универсальных поисковиков. Свое значение он сохраняет и в настоящее время. Причин этому немало. Google индексирует как крупные видеохостинги, так и большое количество проектов поменьше. Это обеспечивает приличную широту охвата. Скорость индексирования «Видео Google» достаточно высока: ролики, размещаемые на принадлежащем Google видеохостинге YouTube, могут попасть в список результатов уже через несколько минут после публикации.
Сервис «Видео Google» отличается лучшими инструментами составления запроса
«Видео Google» предлагает как простой, так и расширенные режимы поиска, причем их интерфейсы выдержаны в привычном для пользователей Google стиле, что упрощает работу. Окно простого режима поиска содержит минимум необходимых настроек. Кроме самого поля для ввода ключевых слов имеются расположенная справа кнопка вызова виртуальной клавиатуры и меню выбора режима «семейного» фильтра. Данный фильтр предлагает три уровня фильтрации: строгая фильтрация, умеренная и отключение фильтра.
Форма расширенного поиска в основном аналогична тем, что используются при нахождении веб-страниц и изображений. Имеется доступ к логическим операторам и поиску по фразе. Предлагается ограничение поиска сайтом или доменом, а также языковой фильтр. Язык видео определяется путем анализа текстовой информации: тегов и описания файла. Собственно к характеристикам видео в форме расширенного поиска относятся только две опции. Длительность ролика можно выбрать из предлагаемого меню. Кроме того, можно вести поиск видео со скрытыми субтитрами.
Дополнительные инструменты уточнения запроса в «Видео Google» вынесены на боковую панель страницы результатов. Здесь доступны как стандартные фильтры современного Google, так и несколько предназначенных именно для работы с видео инструментов – это вышеупомянутые фильтры длительности видеофайлов, а также наличия субтитров. Кроме того, появляется возможность отбора видео, представленного в высоком разрешении.
За это отвечает переключатель «Любое качество / Высокое качество». Еще один специфический фильтр – это перечень видеохостингов, на которых были найдены файлы по вашему запросу. Щелкая по соответствующим ссылкам, можно быстро перейти к результатам какого-либо одного источника. К сожалению, «Видео Google» не предоставляет возможности одновременного выбора нескольких источников.
Страница результатов предлагает только один режим просмотра – простым списком. Задать можно лишь количество ссылок на одной странице. Каждый результат содержит графическую миниатюру видео, его название, сведения о его продолжительности, краткую текстовую выдержку, обычно взятую из описания ролика на видеохостинге, наименование сайта-источника, а также ссылку «Похожие видеоролики», которая открывает список файлов, помеченных на видеохостингах одинаковыми или близкими по смыслу тегами.
«Яндекс.Видео»
Охват поиска «Яндекс.Видео» (video.yandex.ru) также достаточно значителен. Особенно это заметно при поиске по запросам на русском языке. Скорость добавления файлов из крупных источников в индекс системы высокая, ролики попадают в результаты не более чем через несколько часов. При вводе запроса на русском языке работает полноценное автоматическое дополнение предлагаемых пользователем ключевых фраз.
«Яндекс.Видео» предлагает хорошее качество поиска и удобную группировку
На «Яндекс.Видео» доступен только режим простого поиска. Страница результатов отображается в единственном режиме просмотра, предлагая пользователю «плитку» из двух десятков превьюшек. Каждая ссылка сопровождается перечнем тегов или фрагментом текстовой аннотации. Приводится длительность ролика, название видеохостинга, на котором он был найден, а также дата его появления на этом хостинге. Удобное свойство «Яндекс.Видео», выгодно отличающее его от «Видео Google», – опция автоматической фильтрации роликов-дублей. Не секрет, что многие популярные видеофайлы копируются различными пользователями на разных видеохостингах. «Яндекс.Видео» собирает все такие дубли в один результат, который сопровождается ссылкой «Копии». Клик по ней открывает список хостингов, на которых системой были найдены «близнецы».
Найденное видео можно просмотреть, не покидая страницы результатов «Яндекс.Видео». Клик по графической миниатюре откроет ролик в собственном онлайновом плеере системы. Дополнительные фильтры собраны на боковой панели. Фильтр «Источники» позволяет отобрать для просмотра результаты, найденные на собственном видеохостинге «Я.Видео» или же на сторонних ресурсах. Точной фильтрации по конкретному сайту не предусмотрено. Фильтр «Ролики» позволяет отобрать видеофайлы по их продолжительности. К коротким здесь относятся видеоролики длительностью до 10 мин., средним – 10-65 мин., к длинным – файлы продолжительностью более часа.
«Рамблер.Видео»
Rambler (nova.rambler.ru/video) ведет самостоятельную индексацию сетевых видеофайлов. Количество и порядок результатов поиска здесь отличаются от рассмотренных нами выше проектов. Система взаимодействует с рядом популярных видеохостингов. В общей сложности заявлен поиск по 30 млн видеороликов. Система предлагает только простой режим работы. В то же время в строке запроса можно использовать стандартные поисковые операторы «Рамблера», что несколько компенсирует отсутствие расширенного поиска.
«Рамблер.Видео» показывает хорошие количественные результаты поиска
Страница результатов достаточно проста. На ней мозаикой располагаются миниатюры найденных видеороликов. По умолчанию на одной странице выводится 15 миниатюр. При наведении на них курсора демонстрируется нарезка кадров, что достаточно удобно, особенно если кадр, выбранный в качестве миниатюры ролика, не отличается информативностью. Кроме названия приводятся сведения о его длительности, дате публикации, месте хостинга, а также краткая текстовая выдержка из описания.
Если говорить о средствах уточнения запроса, то на «Рамблер.Видео» с этим дела обстоят очень скромно. Предлагается только переключатель режимов сортировки записей – по релевантности и дате, а также опция включения / отключения «семейного» фильтра. Клик по графической миниатюре ведет на страницу ролика на внешнем видеохостинге, какие-либо дополнительные инструменты просмотра отсутствуют.
Bing Videos
Принадлежащий корпорации Microsoft поисковик Bing (www.bing.com/videos) имеет своеобразную подсистему поиска видео. По широте охвата Bing Videos проигрывает рассмотренным нами выше конкурентам. Недостатком данного сервиса для наших пользователей является тот факт, что в настоящее время он не работает со многими национальными, в том числе российскими, видеохостингами, сосредоточившись на индексировании относительно небольшой группы крупных ресурсов. Среди них – MSN, YouTube, AOL, CNN, MTV, MySpace, Dailymotion и Metacafe. В то же время скорость индексирования таких ресурсов достаточно высока: ролики попадают в результаты в считанные минуты.
У поиска видео Bing симпатичный интерфейс, однако шум в результатах велик
Пользовательский интерфейс у Bing Videos довольно удобен и выдержан в подчеркнуто упрощенном стиле. В отличие от многих конкурентов, на странице результатов здесь демонстрируются не просто графические миниатюры, а полноценные видеопревью, выполненные в виде Flash-элементов. Они начинают проигрывать фрагменты исходного видеоролика при наведении на них курсора. Возможно переключение между двумя стилями просмотра результатов: «плиткой» с превью и простым линейным списком. В обоих случаях количество дополнительной информации о найденном файле сведено к минимуму. Это название, продолжительность и дата добавления ролика, не более одной строки текста аннотации и ссылка на сайт-источник.
Режима расширенного поиска в Bing Videos пока не предусмотрено. Инструменты уточнения запроса вынесены на боковую панель. Фильтр «Длина» позволяет отобрать в результатах поиска короткие (до 5 мин.), средние (5-20 мин.) и длинные (более 20 мин.) ролики. Фильтр «Тип экрана» дает возможность искать видеозаписи с разным соотношением сторон кадра: обычные или широкоэкранные. С помощью фильтра «Разрешение» можно выбирать три уровня качества роликов. Надо заметить, что далеко не всегда он срабатывает корректно. Фильтр «Источник» гарантирует быстрый переход к просмотру результатов конкретного видеосервиса. Отсортировать результаты можно по релевантности и дате индексирования.
Англоязычная версия Bing Videos предлагает расширенный набор функций по сравнению с русской. В частности, на данном ресурсе видеоролики представлены в виде каталога, рассортированного по полутора десяткам тематических категорий (News, Sports, Music и др.). Отдельно оформлена категория HD-видео.
Тестирование
Мы тестировали видеопоиск примерно по той же методике, которая применялась нами при сравнении возможностей поиска картинок. Проверяли участников одинаковым запросом на русском языке. Все поисковики работали в «чистом» режиме, без входа в персональные аккаунты. «Семейные» фильтры отключались.
В качестве тестового запроса использовались ключевые слова «группа русские витязи». «Русские витязи» – это в первую очередь известная пилотажная группа, которую охотно и довольно много снимают и профессионалы, и любители. Записи их выступлений размещаются как на крупных ресурсах, так и на не очень известных узкотематических веб-сайтах, поэтому такой запрос позволял оценить широту поиска различных машин. Для проверки возможностей уточнения запроса мы использовали поиск по точной фразе.
Начнем с общих цифр. «Золото» по количеству результатов берет «Рамблер.Видео», который нашел 18 651 ролик. На 2-м месте оказался Bing, продемонстрировавший 4440 видеофайлов. Google набрал всего 719 роликов. На 4-м месте расположился «Яндекс» с результатом в 267 видео.
Теперь проанализируем качество поиска. Лидер общего зачета, Rambler, достаточно свободно оперировал ключевыми словами. Не все ссылки даже на первой странице результатов содержали все три слова из тестового запроса. Наличие кавычек для фразы «Русские витязи» сразу же резко сократило количество результатов до 834, одновременно заметно повысив их релевантность.
Bing определенно работал только с отдельными словами. В итоге список включал в себя в основном ролики, содержащие в названии и описании слово «группа». «Русские» же и «витязи» практически не учитывались, что самым негативным образом сказалось на количестве информационного шума. Более того, даже использование поиска по фразе в запросе практически не дало никакого положительного эффекта.
А вот «Яндекс.Видео» и «Видео Google» продемонстрировали свои лучшие стороны: ключевые слова учитывались совместно, и мусора в результатах было совсем немного. При хорошей общей точности количество нерелевантных результатов не превышало одного-двух десятков на последних позициях. Там же, на последних страницах результатов Google, правда, хватало повторов: одинаковых роликов, отличавшихся разве что датой добавления. Изначально хорошее качество разбора запроса косвенно подтвердилось сравнительно незначительным изменением количества результатов при включении поиска по фразе: Google «просел» до 579 роликов, а «Яндекс.Видео» даже умудрился улучшить показатель, продемонстрировав 393 пункта списка.
Выводы
Подведем итоги нашего небольшого исследования. По возможностям при составлении запроса лидирует Google. Опции уточнения запроса у рассмотренных универсальных поисковиков сопоставимы: это отбор видео по длительности, формату экрана и качеству ролика. Несколько лучше выглядят Google и Bing, позволяющие фильтровать результаты по признаку хостинга.
Поскольку универсальные системы опираются на четкие текстовые характеристики роликов – теги и описания, – точность поиска при конкретно составленном запросе высока. Здесь есть интересное следствие: в более выигрышном положении оказываются поисковики, предлагающие большее количество инструментов для работы с текстом запроса.
В этом плане выделяется Google – единственный сервис в нашем обзоре с режимом расширенного поиска. В случае «Яндекс.Видео» и «Рамблер.Видео» придется полагаться на использование поисковых операторов. Лучшие показатели автоматического разбора запроса продемонстрировали «Видео Google» и «Яндекс.Видео». Rambler обращался с указанными ключевыми словами куда вольнее, а Bing вообще показал неудовлетворительный результат.
По составу фильтров уточнения запроса явно лидирует Google, которому немного уступает «Яндекс». Bing и особенно Rambler по этой характеристике – в аутсайдерах. Если же говорить об удобстве страницы просмотра результатов, то по этому показателю рассмотренные поисковики близки. Преимуществом обладает разве что сервис «Яндекс.Видео», который оснащен опцией группировки одинаковых роликов, а также умеет открывать видеофайлы в собственном плеере. Bing и Rambler предлагают функцию предпросмотра кадров ролика. А вот Google пока может похвастаться только возможностью подписки на RSS-канал по теме вашего запроса.

Алексей Кутовенко
Опубликовано: Upgrade

Поехали, робот!

  Алексей КУТОВЕНКО Распространения роботизированного транспорта можно ожидать уже в самое ближайшее время. Впрочем, как и любая новая тех...