Posts mit dem Label Suchmaschine werden angezeigt. Alle Posts anzeigen
Posts mit dem Label Suchmaschine werden angezeigt. Alle Posts anzeigen

Freitag, Juni 04, 2004

Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: insgesamt zusammengefasst

Introduction

Die Autorin ist der Auffassung, dass Thesauri verändert werden müssen, damit sie für das Information Retrieval wertvoll bleiben. Synonymlisten sind das Minimum für das Information Retrieval. In dieser Weise werden "Thesauri" am häufigsten bereitgestellt. Diesen Synonymlisten mangelt es daran, ähnliche Begriffe aufzeigen zu können: Sie vermögen lediglich andere Bezeichnungen auszuweisen.

Der Thesaurus wird in der Indexierung verwendet, um Indexterme zu vergeben. Dem Suchenden bietet der Thesaurus weitergehende Arten von Relationen, über die mit dem betreffenden Begriff in Beziehung stehende Begriffe gefunden werden können. Die Autorin nennt den Thesaurus ein Hilfsmittel, sich in Begriffsfeldern zurechtzufinden, dort zu navigieren.

Thesauri wurden benötigt, um bibliographischen Datensätzen Indexterme zuzuordnen, um die betreffenden Datensätze überhaupt nochmal wiederfinden zu können: Volltext fehlte, daher waren Indexterme absolut erforderlich und hohe Qualität bei der Vergabe der Indexterme geradezu zwingend.

Nicht jede Information ist digital verfügbar: das betrifft v.a. Texte aus Zeiten vor Erfindung des Computers. Aber auch heute noch erscheinen machne Publikationen ausschließlich als Printprodukte. - Die Autorin reduziert die verbleibende Daseinsberechtigung von Thesauri und Indexierung darauf, Zugang zu diesen nicht-digitalen Dokumenten zu ermöglichen.


Thesauri And Search Engines

Thesauri kommen sowohl beim Abrufen von Information als auch beim ("storage") zum Einsatz.

Die Autorin unterscheidet zwei Arten von Werkzeugen, die den Zugriff auf Volltexte ermöglichen: "exact-match (boolean)"-Suchsysteme und Statistik-basierte Suchsysteme. [wrs, pauschalisiert gesprochen:] Beide liefern in etwa dieselbe Zahl relevanter Treffer, doch ihre Ergebnismengen unterscheiden sich deutlich.


Use of Thesauri in Searching (1-5)

Bisher galt, das Thesauri eingesetzt wurden, um Terme zu erhalten: Der Indexierende für die Zuordnung (von Indextermen) zu Dokumenten, der Suchende für die Suche. Ob letzterer Zweck erfüllt/erreicht wird, erscheint zweifelhaft. Die Autorin führt Gründe an.

Thesauri werden von Suchenden zu selten genutzt. Die Autorin nennt als mögliche Ursache Unebenheiten, die auftreten, wenn man einen Thesaurus einsetzen will und schlägt als Gegenmaßnahme vor, diese Unebenheiten zu beseitigen. Die Autorin erwähnt eine Technik, einen Thesaurus dergestalt zu nutzen, dass der Recall zunimmt, ohne dass die Precision wesentlich darunter leidet. Die Autorin geht mit einem Absatz auf Endnutzer-Thesauri ein, die in Zshg. dieser DA aber vermutlich keine Rolle spielen werden.

Use of Thesauri in Searching (6+7)

Bis vor kurzem scheint man, nach Auffassung der Autorin, nicht erkannt zu haben, dass bei wachsender Volltext-Menge der Bedarf des Nutzers an Unterstützung und Navigation selbst dann wächst, wenn ein leistungsstarkes Suchwerkzeug bereitsteht.

Die Autorin erwähnt Semantische Netze als Ansatz, die Entwicklung von Enduser-Thesauri zu umgehen, zeigt aber gleichzeitig auf, dass dieser Ansatz die beabsichtigte Wirkung verfehlt hat.

(Quelle @ 20040604-05. _, Auszüge aus den Abschnitten "Introduction" bis "Use of Thesauri in Searching"; bereits paraphrasierte/exzerpierte Versionen dieser Abschnitte: Introduction (Abs. 1-6), Thesauri And Search Engines (Abs. 1+2), Use of Thesauri in Searching (Abs. 1-5, 6+7))

Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Use of Thesauri in Searching, Abs.6+7

"Use of Thesauri in the Full-Text Environment", Abschnitt "Use of Thesauri in Searching"

Abs. 6
Endnutzer-Thesauri haben keine weite Verbreitung gefunden: Thesauri zu entwickeln, ist per se teuer. Dann noch einen Endnutzer-Thesaurus hinzuzufügen, würde weitere Kosten verursachen. - Gleichzeitig scheint man bis vor Kurzem nicht verstanden zu haben, dass bei wachsender Volltext-Menge auch der Bedarf des Nutzers an Unterstützung und Navigation auch dann wächst, wenn ein kraftvolles Suchwerkzeug bereitsteht.

Abs. 7
[so lala paraphrasiert] Ein semantisches Netz würde, nach Auffassung der Autorin, in etwa das Gleiche leisten wie ein Endnutzer-Thesaurus, aber ungefähr gleichteuer in der Entwicklung. Existierende semantische Netze, etwa WordNet, hat Retrieval-Ergebnisse nicht wesentlich verbessert, vielleicht - nach Ansicht der Autorin - deswegen nicht, weil der Fokus der betreffenden semantischen Netze nicht mit denen der Gruppe der Suchenden übereinstimmt. [/so lala paraphrasiert]

(Quelle @ 20040604-07. _, Abschnitt "Use of Thesauri in Searching", ...)

Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Thesauri And Search Engines, Abs. 1+2

"Use of Thesauri in the Full-Text Environment", Abschnitt "Thesauri And Search Engines":

Abs. 1
Thesauri actually have a place at both ends of the information access process, at both storage and retrieval. The amount of electronically accessible full text is so immense, and is growing so fast, that users need all the help they can get in accessing it. The explosive growth of Web search engines, with their primitive algorithms, has had some rather unfortunate effects, to my mind. Some of these engines appear to have been developed by people who saw a need, but who had not the vaguest idea that there was already a history of development of tools to fulfill similar needs. There is little evidence that some of these developers had ever used either Dialog or a library catalog.

Tatsächlich haben Thesauri ihren Platz an beiden Enden des Prozesses des Informationszugriffs, beim Hinterlegen/Ablegen/Speichern und beim Retrieval. Die Menge elektronisch zugreifbaren Volltextes ist so immens und so schnell wachsend, dass Nutzer alle Hilfe benötigen, die sie bekommen können, um diese Menge von Volltext erreichen zu können. Das explosive Wachstum von Websuchmaschinen mit ihren primitiven Algorithmen hatten nach Meinung der Autorin ein paar ziemlich unglückliche Seiteneffekte: Einige dieser Maschinen scheinen, nach Ansicht der Autorin, von Leuten entwickelt worden zu sein, die einen Bedarf gesehen haben, die aber nicht die entfernteste Idee hatten, dass bereits eine Vergangenheit der Entwicklung von Werkezugen existierte, deren Ziel war, ähnliche Bedürfnisse zu decken. Es gibt wenig Anzeichen, daß irgendeiner dieser Entwickler jemals Dialog oder einen Bibliothekskatalog genutzt hat.

[==] Thesauri kommen sowohl beim Einlagern ("storage") als auch beim Abrufen von Informationen zum Einsatz. Die Autorin ist der Auffassung, dass die Entwickler der Websuchmaschinen nicht den Hauch einer Ahnung hatten, dass die Entwicklung von entsprechender (Wiederfinde-)Werkzeuge bereits eine lange Tradition hat.


Abs. 2
We should distinguish kinds of tools for facilitating access to full text on the basis of the attention they give to semantics. Older, exact-match (Boolean) systems give no attention to semantics. The search terms must appear in the document for it to be retrieved; if a term appears at all the document will be retrieved regardless of whether the term is important to the meaning of the document or not. Another approach relies on statistical information -- co-occurrence of words in the document, frequency, etc. Boolean and statistically-based systems have been found to have comparable retrieval performance, but to produce very different retrieval sets. That is, searches of the same database using a Boolean engine and a statistically-based one often produce about the same number of relevant hits, but there may be little overlap between the two sets of hits.

Auf Basis der Aufmerksamkeit, die sie der Semantik widmen, sollten wir (!) verschiedene Arten von Werkzeugen unterscheiden, die den Zugriff auf Volltexte erleichtern. Ältere buchstabengetreue boolsche Systeme ("exact-match (Boolean) systems") schenkten Semantik keine Aufmerksamkeit: Die Suchterme müssen in dem Dokument erscheinen, damit es geliefert ("retrieved") wird; wenn der Term in dem Dokument erscheint, wird das Dokument unabhängig davon geliefert, ob der Term wichtig für die Bedeutung des Dokumentes ist oder nicht. Ein anderer Ansatz vertraut auf statistische Information -- gemeinsames Auftreten von Wörtern im Dokument, Häufigkeit etc. Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben, dass sie aber sehr verschiedene Ergebnismengen produzieren, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen häufig zu Treffermengen mit etwa gleich vielen relevanten Treffern, doch die Trefermengen überschneiden einander nur geringfügig.

[==] Die Autorin schlägt vor, verschiedene Arten von Werkzeugen zu unterscheiden. Als Kriterium für die Differenzierung legt sie dabei die Aufmerksamkeit an, mit der verschiedene Werkzeuge die Semantik berücksichtigen: Exact-Match-Systeme schenken der Semantik keine Aufmerksamkeit (Treffer, wenn Wort im Text enthalten, unabhängig davon, ob dieser im Text überhaupt eine Rolle spielt), Statistik-basierte Systeme beachten [wrs: zumindest] gemeinsam auftretende Wörter, Häufigkeit von Wörtern u.a. "Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben" ("Boolean and statistically-based systems have been found to have comparable retrieval performance"), dass sie aber sehr verschiedene Ergebnismengen liefern, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen "häufig zu einer etwa gleich großen Anzahl relevanter Treffer" ("often [...] about the same number of relevant hits"), doch die Treffermengen selbst überschneiden einander nur geringfügig.


Abs. 3-5
./.

(Quelle @ 20040604-05. _, Abschnitt "Thesauri And Search Engines", ...)

Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Introduction

"Use of Thesauri in the Full-Text Environment", Abschnitt "Introduction":

Abs. 1
IR hat sich i.d. jüngster Zeit durch die immens angewachsene Verfügbarkeit durchsuchbaren Volltextes - zzgl. der Suchmaschinen, die diesen Text durchsuchen können - dramatisch verändert. Daher stellt die Autorin sich die Frage, ob da [in dieser neuen IR-Umgebung] überhaupt noch Platz ist für Thesauri. Sie glaubt, dass da noch ein Platz für Thesauri - oder irgendwas in ihrer Art - ist, doch dass sie sich ändern müssen, damit sie wertvoll bleiben. Sie schränkt gleichzeitig ein, dass schwer vorherzusagen ist, welcher Art diese Änderungen sein müssen.

[==] IR hat sich durch die gewachsene Verfüg- und Durchsuchbarkeit immenser Mengen von Volltexten deutlich geändert. Die Autorin ist der Auffassung, dass Thesauri in diesem Kontext ihre Daseinsberechtigung nicht eingebüßt haben, aber verändert werden müssen, damit sie wertvoll bleiben. Welcher Art diese Änderungen sein müssen, nennt sie "schwer vorhersagbar" ("hard to predict").


Abs. 2
Die Autorin nennt einen Thesaurus "mehr als eine simple" Synonymliste, wobei sie statt des Terms "Synonym" lediglich "equivalence" verwendet ("more than a simple equivalence list"). Dieser Art "Thesaurus" wird von Textretrieval-Systemen am häufigsten bereitgestellt und ist "lebenswichtig" ("vital") für das effektive IR, aber nicht genug, da sie lediglich dazu geeignet seien, Begriffe auszudrücken, "die man schon im Kopf hat" ("which is already in the user's mind"), dem Nutzer aber keine Begriffe aufzeigen, die zu dem bereits bekannten in Bezug stehen -- die aber bei der Suche wertvoll sein könnten.

[==] Die Autorin hält "Thesauri" im Sinne von Synonymwörterbüchern für nicht ausreichend für das IR, da solche lediglich dazu geeignet seien, bereits bekannte Begriffe anders auszudrücken, nicht aber dazu, mit diesen Begriffen in Vbdg. stehende andere Begriffe zu finden. Diese anderen Begriffe aber könnten bei der Suche hilfreich sein.


Abs. 3
Ein echter Thesaurus bietet neben Synonymrealtionen auch andere Arten von Relationen, z.B. genus-species, und bietet "navigationale" Unterstützung durch Angaben zum Gültigkeitsbereich (Synonymzusätze?) und andere Hilfen. Die Autorin nennt einen Thesaurus ein Werkzeug, das dazu gedacht ist, Nutzern dabei zu helfen, ihren Weg durch Begriffsdatenbanken ("vocabulary databases") zu finden. Zusätzlich zu seiner herkömmlichen Anwendung als eine Instanz ("authority") für Terme, die bei der Indexierung der DB verwendet werden/zum Einsatz kommen, erinnert er den Nutzer an Terme, die er mglw. nicht bedacht hat.

[==] Bei der Indexierung wird der Thesaurus genutzt, um Indexterme zu vergeben. Dem (abfragenden) Nutzer bietet er (der Thesaurus), durch über die Synonymrelation hinausgehende Arten von Relationen, Hinweise auf weitere, bei der Suche potenziell nützliche Begriffe - und Terme. Die Autorin nennt den Thesaurus ein Werkzeug, das dazu gedacht ist, Nutzer darin zu unterstützen, durch Begriffsdatenbanken ("vocabulary databases") zu navigieren, d.h. um sich in Begriffsfeldern zurechtzufinden.

Abs. 4
The ANSI/NISO standard for thesauri (National Information Standards Organization, 1994) provides the best available information on what thesauri should do and how they should be built, but it predates the recent explosion of full text and powerful search engines, and it is not an adequate guide to future needs and potential.

Der ANSI/NISO-Standard für Thesauri bietet, laut der Autorin, die beste Information darüber, was Thesauri leisten sollen und wie sie erstellt werden sollen. Aber dieser Standard datiert die jüngste Explosion von Volltext und kraftvollen Suchmaschinen, und er ist kein adäquater Leitfaden für zukünftige Bedürfnisse und Potenzial.

[==] Laut der Autorin ist der ANSI/NISO-Standard für Thesauri die beste Informationsquelle dafür, was Thesauri leisten sollen und wie sie erstellt werden sollen, ist aber, nach Ansicht der Autorin, kein adäquater Leitfaden im Hinblick auf zukünftigen Bedarf und Potenzial...


Abs. 5
The first thesauri were produced before electronic searching became widely available, but their full development coincided with the growth of online bibliographic databases. The earliest electronic files consisted only of titles, bibliographic descriptions, and indexing; if you were lucky there were abstracts, but this was not to be taken for granted when storage space was a very precious commodity and acquiring anything in electronic form generally meant rekeying it. In this environment, indexing had to be of high quality if information was to be retrieved at all. Hence the obvious need for thesauri.

[==] Die ersten Thesauri entstanden, ehe digitales Suchen weitverbreitet war. Ihre Ausgestaltung vollzog sich zu Zeiten, in denen bibliographische Online-Datenbanken wuchsen. In dieser Zeit war Massenspeicher teuer und, Abstracts aufzunehmen, implizierte, dass diese abgetippt werden mussten. Daraus entstand der Bedarf nach Thesauri: Abstracts waren selten, und wenn man die Datensätze überhaupt nochmal wiederfinden wolle, musste die Indexierung von hoher Qualität sein. [wrs: Selten vorkommende Stichwörter hätte man vermutlich sehr selten überhaupt für die Suche verwendet, bei häufig vorkommenden Stichwörtern hätte man leicht einen riesigen Recall erhalten können, in dem die eigentlich interessanten Treffer untergehen konnten - so wie man heute bei Ergebnissen der Suchmaschinen spätestens nach Seite 3 der den Rest der Trefferliste verwirft.]


Abs.6
Today it is beginning to seem as if all information is available in full text. However, this is not true, nor will it be true in the immediate future. Vast numbers of legacy documents remain, and converting these to searchable text is an expensive, long-term proposition. Furthermore, many documents are still being produced only in printed form. Therefore, thesauri and indexing will continue to have a place ­ at least for awhile ­ in facilitating access to documents for which electronic text is not available. Their long-run value, however, depends on integration with full-text search.

Heutzutage beginnt der Eindruck zu entstehen, als ob alle Information als Volltext verfügbar wäre. Tatsächlich ist dies nicht wahr [nicht der Fall], es auch wird es nicht [auch nicht] in nächster Zukunft nicht wahr [der Fall] sein: Gewaltige Mengen von alter Dokumente ("legacy documents") [nicht-digitaler Dokumente] bleiben übrig ("remain"), und diese zu konvertieren, ist ein teures, langwieriges Geschäft. Abgesehen davon werden [auch heute] noch zahlreiche Dokumente ausschließlich in gedruckter Form produziert. Daher werden Thesauri und Indexierung - zumindest für eine Weile - noch einen Platz darin, den Zugriff auf Dokumente zu unterstützen, für die elektronischer Text nicht vorliegt. Allerdings hängt ihr langfristiger Wert davon ab, wie sehr sie mit Volltextsuche integrieren.

Diese Position war mir von anderen Autoren bislang nicht bekannt.

[==] Allmählich entwickelt sich der Eindruck, jede Information wäre als digitaler Volltext vefügbar - doch dieser Eindruck trügt, und daran wird sich auch in naher Zukunft nichts ändern: Es existieren gewaltige Mengen von Text, die niemals in digitaler Form erschienen sind - etwa Dokumente aus Zeiten vor Erfindung des Computers. Daneben erscheinen noch heute zahlreiche Dokumente ausschließlich in gedruckter Form. Entsprechend haben, laut der Autorin, Thesauri und Indexierung zumindest noch für eine Weile eine Daseinsberechtigung darin, den Zugang zu solchen Dokumenten zu erleichtern, die eben nicht als Volltext vorliegen. Dabei macht die Autorin den langfristigen Wert beider davon abhängig, wie sehr sie mit der Volltextsuche integrieren. [wrs: Beachtenswert finde ich in diesem Zusammenhang, dass die Autorin Volltextsuche anscheinend als unabhängig von einer Indexierung betrachtet. - Meiner Meinung nach ist Indexierung wesentlicher Bestandteil auch der Volltextsuche: SQL - Standardabfragesprache auch moderner Datenbanken - stellt immer noch eine Mglk. bereit, einen Index über Tabellen der DB zu erstellen -- IMHO, aber noch nicht belegt, weil dadurch die Abfrage beschleunigt werden kann. Ohne Indexierung wäre IMO eine sequenzielle Suche erforderlich, die bis heute merklich langsamer ist als die über einen Index. -- Wobei sich letzlich kaum ausschließen lässt, dass durch immer schneller werdende Hardware irgendwann die Situation entsteht, dass ein Nutzer zwischen einer sequenziellen Suche und einer Suche vermittels eines Index'keinen Unterschied mehr bemerkt. Wie gesagt: IMO]

(Quelle @ 20040604-03.14..04.51, Abschnitt "Introduction", alle Absätze)

Dienstag, Juni 01, 2004

DA-Themen: andere

Nja, ich weiß jetzt nicht, wohin mit diesem Eintrag, daher poste ich es erstmal hier. Zum Thema dieses Blogs passt es nicht, aber zum Thema DA - da aber wieder nicht zu meiner DA, denn das hier stellt einen Ansatzpunkt zu einer anderen DA dar. Ich glaube, Kerstin S. war es, die mich vor ein paar Tagen danach fragte, aber mir fiel dieses Thema spontan nicht wieder dazu ein. Daher blogge ich es.

Es läuft auf eine Evaluation von Suchmaschinen hinaus: Inwieweit ist es heutzutage möglich, eine DA zu einem aktuellen Thema ausschließlich Web-gestützt zu fundieren? Welche Suchmaschinen wurden benutzt? Was macht sie herausragend? Wo liegen Schwachstellen? Wie sehr helfen sie in Bezug auf eine DA? – Oder breiter formuliert: Ersetze "DA" durch "Beschaffung wissenschaftlicher Literatur".

Update @ 20040606-08.40:
Wissenschaftliche Information im elektronischen Zeitalter gibt es bereits als Postscript.