Оригинальные учебные работы для студентов


Контрольная работа по информатике поиск информации

Технология поиска с использованием поисковых машин………………8 Заключение………………………………………………………………. Будь то реферат, курсовая работа либо документация к новой стиральной машине, поиск этой информации может занять у вас от пяти минут до нескольких часов — все зависит от умения искать и находить нужные данные в Интернете.

В этом случае нам на помощь приходят всевозможные поисковые машины, каталоги и базы знаний. Овладение эффективными методами и средствами поиска, обработки использования информации дает большие возможности.

Информационные ресурсы сети Интернет Благодаря повсеместному развитию и применению компьютерных технологий в настоящее время в той или иной электронной форме находится информация всех областей человеческой деятельности: Сеть Интернет имеет совместимость с различными электронными сетями и базами данных и позволяет получить удобный доступ практически к любому виду информации.

Для миллионов людей разных профессий, а особенно для учащихся, Интернет стал необходимым инструментом в работе и универсальным средством развлечения в часы досуга. В связи с этим возникает потребность в программных средствах, эффективно решающих проблемы поиска необходимой пользователю сети Интернет информации.

Информационные ресурсы, доступные через Интернет, огромны. Это десятки миллионов документов, представленных различными способами, число которых постоянно увеличивается. В зависимости от способа представления, вида и характера информации разнятся и методы доступа к ней, поэтому, прежде чем рассматривать методы поиска, рассмотрим классификацию информационных ресурсов.

По принципу организации использования средства поиска можно разделить контрольная работа по информатике поиск информации каталоги справочники, директории и поисковые машины. Каталоги Каталоги являются справочниками, содержащими списки адресов Интернет, сгруппированные по определенным признакам. Как правило, они объединяются по тематике контрольная работа по информатике поиск информации, искусство, новости и т.

Особенность этих средств поиска информации состоит в том, что создание структуры, контрольная работа по информатике поиск информации данных их постоянное обновление осуществляется "вручную", коллективом редакторов и программистов, и сам процесс поиска требует непосредственного участия пользователя, самостоятельно переходящего контрольная работа по информатике поиск информации ссылки к ссылке. Поисковые машины Действие поисковых машин заключается в постоянном последовательном исследовании всех узлов Интернет, доступных данной системе поиска, со всеми их связями и ответвлениями.

В связи с постоянным обновлением информации машина поиска регулярно возвращается через определенный срок порядка месяца к уже изученным узлам, чтобы обнаружить и зарегистрировать изменения.

Вся прочитанная информация индексируется, то есть создается специализированная база данных, в которой закодированы все исследованные системой страницы Интернет. При поступлении запроса от пользователя машина поиска рассматривает всю индексированную информацию и выдает список документов, соответствующих задаче поиска.

Найденные документы ранжируются в зависимости от контрольная работа по информатике поиск информации ключевых слов в заголовке, в начале текста, в первых параграфах и контрольная работа по информатике поиск информации их появления в тексте. Несмотря на схожий принцип работы, машины поиска различаются по языкам запроса, зонам поиска, глубине поиска внутри документа, методам ранжирования и приоритетов, поэтому применение разных поисковых машин дает различные результаты.

Типология методов поиска Более или менее серьезный подход к любой задаче начинается с анализа возможных методов ее решения. Поиск информации в Интернете может быть произведен по нескольким методам, значительно различающимся как по эффективности и качеству поиска, так и по типу извлекаемой информации. В ряде случаев приходится использовать весьма трудоемкие методы - результат того стоит. Можно выделить следующие основные методы поиска информации в Интернете, которые, в зависимости от целей и задач ищущего, используются по отдельности или в комбинации друг с другом: Непосредственный поиск с использованием гипертекстовых ссылок Поскольку все сайты в пространстве WWW фактически оказываются связанными между собой, поиск информации может быть произведен путем последовательного просмотра связанных страниц с помощью браузера.

Хотя этот полностью ручной метод поиска выглядит полным анахронизмом в Сети, содержащей более 60 млн. Использование каталогов, классифицированных и тематических списков и всевозможных небольших справочников также относится к этому виду поиска. Использование поисковых машин Сегодня этот метод является одним из основных и фактически единственным при проведении предварительного поиска.

Результатом последнего может являться список ресурсов Cети, подлежащих детальному рассмотрению.

Поиск информации в глобальной сети Интернет

Как правило, применение поисковых машин основано на использовании ключевых слов, которые передаются поисковым серверам контрольная работа по информатике поиск информации качестве аргументов поиска: Если делать все правильно, то формирование списка ключевых слов требует предварительной работы по составлению тезауруса. Поиск с применением специальных средств Этот полностью автоматизированный метод может оказаться весьма эффективным для проведения первичного поиска.

Одна из технологий этого метода основана на применении специализированных программ - спайдеров, которые в автоматическом режиме просматривают Web-страницы, отыскивая на них искомую информацию. Фактически это автоматизированный вариант просмотра с помощью гипертекстовых ссылок, описанный выше поисковые машины для построения своих индексных таблиц используют похожие методы. Нет нужды говорить, что результаты автоматического поиска обязательно требуют последующей обработки.

Применение данного метода целесообразно, если использование поисковых машин не может дать необходимых результатов например, в силу нестандартности запроса, который не может быть адекватно задан существующими средствами поисковых машин. В ряде случаев этот метод может быть очень эффективен. Выбор между использованием спайдера или поисковых контрольная работа по информатике поиск информации являет собой вариант классического выбора между применением универсальных или специализированных средств.

Анализ новых ресурсов Поиск по новообразованным ресурсам может оказаться необходимым при проведении повторных циклов поиска, поиска наиболее свежей информации или для анализа тенденций развития объекта исследования в динамике.

Другой возможной причиной может явиться то, что большинство поисковых машин обновляет свои индексы со значительной задержкой, вызванной гигантскими объемами обрабатываемых данных, и эта задержка обычно тем больше, чем менее популярна интересующая тема. Это соображение может оказаться весьма существенным при проведении поиска в узкоспециальной предметной области.

Технология поиска с использованием поисковых машин Определение географических регионов поиска Поскольку проведение информационного поиска преследует практические цели - практическая ценность информационного ресурса может контрольная работа по информатике поиск информации от географического расположения соответствующего контрольная работа по информатике поиск информации. Составление тезауруса Для эффективного использования поисковых серверов необходим список ключевых слов, организованный с учетом семантических отношений между ними, то есть тезаурус.

При составлении тезауруса необходимо предусмотреть обработку синонимов, контрольная работа по информатике поиск информации и морфологических вариаций ключевых слов. Использование законов Зипфа Число, показывающее сколько раз встречается слово в тексте, называется частотой вхождения слова.

Если расположить частоты по мере убывания и пронумеровать, то порядковый номер частоты называется ранг частоты. Зипф нашел, что если умножить вероятность обнаружения слова в тексте на ранг частоты, то получившаяся величина приблизительно постоянна для всех текстов на одном языке: Зипф также установил, что зависимость количества слов с данной частотой от частоты - также гипербола и постоянная для всех текстов в пределах одного языка.

Что можно извлечь из этих законов? Исследования вышеуказанных зависимостей для различных текстов показали, что наиболее значимые слова текста лежат в средней части диаграммы, так как слова с максимальной частотой как правило являются предлогами, частицами, местоимениями, в английском языке - артиклями так называемые "стоп-слова"а редко встречающиеся слова в большинстве случаев не имеют решающего значения.

Основываясь на этой закономерности, можно предложить следующую методику.

Составление списка ключевых слов Для составления оптимального набора ключевых слов используют процедуру, основанную на применении законов Зипфа, которая заключается в следующем: В качестве текста-источника может служить книга, статья, Web-страница, любой другой документ. Анализ текста производится таким образом: Удаление из текста стоп-слов.

Вычисление частоты вхождения каждого слова и составление списка, в котором слова расположены в контрольная работа по информатике поиск информации убывания их частоты. Выбор диапазона частот, лежащего в середине списка, и отбор из этого диапазона слов, наиболее полно соответствующих смыслу текста.

Библиотека

Составление запроса к поисковой машине в форме перечисления отобранных таким образом ключевых слов, связанных логическим оператором ИЛИ OR. Запрос в таком виде позволяет обнаружить тексты, в которых встречается хотя бы одно из перечисленных слов.

Число документов, полученных контрольная работа по информатике поиск информации результате поиска по этому запросу, может быть огромно. Однако, благодаря ранжированию документов расположению их в порядке убывания частоты вхождения слов запроса в документприменяемому в большинстве поисковых машин, на первых страницах списка практически все документы окажутся релевантными, причем документ-источник может находиться далеко от начала.

Более адекватной представляется структура тезауруса в виде так называемых семантических срезов, где для каждого основного термина отдельно строится таблица сопутствующих слов и слов шумовых которые не должны встречаться в источникеконтрольная работа по информатике поиск информации некоторые поисковые машины AltaVista позволяют это использовать.

Таким образом, контрольная работа по информатике поиск информации единой иерархической структуры терминов мы получаем пакет таблиц, которые могут расширяться контрольная работа по информатике поиск информации модифицироваться отдельно. Отбор поисковых машин Устанавливается последовательность использования поисковых машин в соответствии с убыванием ожидаемой эффективности поиска с применением каждой машины.

Всего известно около 180 поисковых серверов, различающихся по регионам охвата, принципам проведения поиска а следовательно, по входному языку и характеру воспринимаемых запросовобъему индексной базы, скорости обновления информации, способности искать "нестандартную" информацию и тому подобное. Основными критериями выбора поисковых серверов являются объем индексной базы сервера и степень развитости самой поисковой машины, то есть уровень сложности воспринимаемых ею запросов.

Составление и выполнение запросов к поисковым машинам Это наиболее сложный и трудоемкий этап, связанный с обработкой большого количества информации в основном шумовой.

На основе тезауруса формируются запросы к выбранным поисковым серверам, после чего возможно уточнение запроса с целью отсечения очевидно нерелевантной информации. Затем производится отбор ресурсов, начиная с наиболее интересных, с точки зрения целей поиска.

Данные с ресурсов, признанных релевантными, собираются для последующего анализа. Формирование запросов Как формат, так и семантика запросов варьируются в зависимости от применяемой поисковой машины и конкретной предметной области. Запросы составляются так, чтобы область поиска была максимально конкретизирована и сужена. Предпочтение отдается использованию нескольких узких запросов по сравнению с одним расширенным.

В общем случае для каждого основного понятия из тезауруса готовится отдельный пакет запросов. Так же производится пробная реализация запросов - как для уточнения и пополнения тезауруса, так и с целью отсечения шумовой информации.

Результат запроса список ссылок обрабатывается в два этапа. На первом этапе производится отсечение очевидно нерелевантных источников, попавших в выборку в силу несовершенства поисковой машины или недостаточной "интеллектуальности" запроса.

Параллельно проводится семантический анализ, имеющий целью уточнение контрольная работа по информатике поиск информации для модификации последующих запросов. Дальнейшая обработка производится путем последовательного обращения на каждый из найденных ресурсов и анализа находящейся там информации.

Анализ ресурсов и сбор информации Первичный анализ ресурсов основывается на аннотациях - в случае их наличия, и в необходимых случаях - на ознакомлении с информационным наполнением ресурса. Информация с отобранных источников извлекается с использованием соответствующих конкретному источнику методов, что может потребовать значительных коммуникационных, вычислительных и дисковых ресурсов.

В русскоязычной части Интернета в настоящее время доступен ряд ресурсов, предоставляющих вторичную информацию, как правило, в табулированной форме. Предоставление информации для публикации в подобных источниках является более дешевым вариантом для компаний, не имеющих собственного представительства в Интернете.

Заключение Можно прийти к выводу, что в сети Интернет хранится очень большой объем информации по различной тематике в виде статей в электронных газетах, отчетов, справочников, графических изображений, аудио- и видео-файлов и многого другого. Путешествуя по Интернет, можно найти любую информацию, иначе говоря, если какие-либо данные вводились когда-либо в компьютер, то вероятнее всего их можно найти где-то на необозримых просторах Интернет.

Контрольная работа по информатике поиск информации к некоторым данным возможен только для ограниченного числа пользователей после регистрации и получения индивидуального пароля.

  1. Составление тезауруса Для эффективного использования поисковых серверов необходим список ключевых слов, организованный с учетом семантических отношений между ними, то есть тезаурус. Анализ новых интернет ресурсов.
  2. В зависимости от способа представления, вида и характера информации разнятся и методы доступа к ней, поэтому, прежде чем рассматривать методы поиска, рассмотрим классификацию информационных ресурсов. Поиск информации с помощью поисковых ресурсов.
  3. Использование законов Зипфа Число, показывающее сколько раз встречается слово в тексте, называется частотой вхождения слова. Одна из технологий этого метода основана на применении специализированных программ - спайдеров, которые в автоматическом режиме просматривают Web-страницы, отыскивая на них искомую информацию.
  4. Поисковые системы и способы поиска информации.

С контрольная работа по информатике поиск информации World Wide Web WWW - гипертекстовой информационной системы, опутавшей весь мир, связавшей сотни и сотни компьютеров, тысячи и тысячи страниц гипертекстовых документов - без высокоэффективных средств поиска просто не обойтись. Средства или "машины" поиска - это специальные программно-технические комплексы, отслеживающие изменения информации в Интернет. Существует множество средств поиска в Интернет, как автономных, использующих только собственные ресурсы, так и глобальных, так называемых мета-средств.

Методика поиска информации

Существуют разные методы поиска информации в сети Интернет: Автоматизированные информационные технологии в экономике. Финансы и статистика, 2002 2. Информационные технологии для менеджеров. Финансы и статистика, 2002 3. Информационные технологии бухгалтерского учета.

Информатика для юристов и экономистов. Интеллектуальные информационные системы в экономике. Экзамен, 2003 Похожие страницы:

VK
OK
MR
GP