Freitag, Juni 04, 2004

Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Thesauri And Search Engines, Abs. 1+2

"Use of Thesauri in the Full-Text Environment", Abschnitt "Thesauri And Search Engines":

Abs. 1
Thesauri actually have a place at both ends of the information access process, at both storage and retrieval. The amount of electronically accessible full text is so immense, and is growing so fast, that users need all the help they can get in accessing it. The explosive growth of Web search engines, with their primitive algorithms, has had some rather unfortunate effects, to my mind. Some of these engines appear to have been developed by people who saw a need, but who had not the vaguest idea that there was already a history of development of tools to fulfill similar needs. There is little evidence that some of these developers had ever used either Dialog or a library catalog.

Tatsächlich haben Thesauri ihren Platz an beiden Enden des Prozesses des Informationszugriffs, beim Hinterlegen/Ablegen/Speichern und beim Retrieval. Die Menge elektronisch zugreifbaren Volltextes ist so immens und so schnell wachsend, dass Nutzer alle Hilfe benötigen, die sie bekommen können, um diese Menge von Volltext erreichen zu können. Das explosive Wachstum von Websuchmaschinen mit ihren primitiven Algorithmen hatten nach Meinung der Autorin ein paar ziemlich unglückliche Seiteneffekte: Einige dieser Maschinen scheinen, nach Ansicht der Autorin, von Leuten entwickelt worden zu sein, die einen Bedarf gesehen haben, die aber nicht die entfernteste Idee hatten, dass bereits eine Vergangenheit der Entwicklung von Werkezugen existierte, deren Ziel war, ähnliche Bedürfnisse zu decken. Es gibt wenig Anzeichen, daß irgendeiner dieser Entwickler jemals Dialog oder einen Bibliothekskatalog genutzt hat.

[==] Thesauri kommen sowohl beim Einlagern ("storage") als auch beim Abrufen von Informationen zum Einsatz. Die Autorin ist der Auffassung, dass die Entwickler der Websuchmaschinen nicht den Hauch einer Ahnung hatten, dass die Entwicklung von entsprechender (Wiederfinde-)Werkzeuge bereits eine lange Tradition hat.


Abs. 2
We should distinguish kinds of tools for facilitating access to full text on the basis of the attention they give to semantics. Older, exact-match (Boolean) systems give no attention to semantics. The search terms must appear in the document for it to be retrieved; if a term appears at all the document will be retrieved regardless of whether the term is important to the meaning of the document or not. Another approach relies on statistical information -- co-occurrence of words in the document, frequency, etc. Boolean and statistically-based systems have been found to have comparable retrieval performance, but to produce very different retrieval sets. That is, searches of the same database using a Boolean engine and a statistically-based one often produce about the same number of relevant hits, but there may be little overlap between the two sets of hits.

Auf Basis der Aufmerksamkeit, die sie der Semantik widmen, sollten wir (!) verschiedene Arten von Werkzeugen unterscheiden, die den Zugriff auf Volltexte erleichtern. Ältere buchstabengetreue boolsche Systeme ("exact-match (Boolean) systems") schenkten Semantik keine Aufmerksamkeit: Die Suchterme müssen in dem Dokument erscheinen, damit es geliefert ("retrieved") wird; wenn der Term in dem Dokument erscheint, wird das Dokument unabhängig davon geliefert, ob der Term wichtig für die Bedeutung des Dokumentes ist oder nicht. Ein anderer Ansatz vertraut auf statistische Information -- gemeinsames Auftreten von Wörtern im Dokument, Häufigkeit etc. Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben, dass sie aber sehr verschiedene Ergebnismengen produzieren, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen häufig zu Treffermengen mit etwa gleich vielen relevanten Treffern, doch die Trefermengen überschneiden einander nur geringfügig.

[==] Die Autorin schlägt vor, verschiedene Arten von Werkzeugen zu unterscheiden. Als Kriterium für die Differenzierung legt sie dabei die Aufmerksamkeit an, mit der verschiedene Werkzeuge die Semantik berücksichtigen: Exact-Match-Systeme schenken der Semantik keine Aufmerksamkeit (Treffer, wenn Wort im Text enthalten, unabhängig davon, ob dieser im Text überhaupt eine Rolle spielt), Statistik-basierte Systeme beachten [wrs: zumindest] gemeinsam auftretende Wörter, Häufigkeit von Wörtern u.a. "Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben" ("Boolean and statistically-based systems have been found to have comparable retrieval performance"), dass sie aber sehr verschiedene Ergebnismengen liefern, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen "häufig zu einer etwa gleich großen Anzahl relevanter Treffer" ("often [...] about the same number of relevant hits"), doch die Treffermengen selbst überschneiden einander nur geringfügig.


Abs. 3-5
./.

(Quelle @ 20040604-05. _, Abschnitt "Thesauri And Search Engines", ...)

Keine Kommentare: