Introduction
Die Autorin ist der Auffassung, dass Thesauri verändert werden müssen, damit sie für das Information Retrieval wertvoll bleiben. Synonymlisten sind das Minimum für das Information Retrieval. In dieser Weise werden "Thesauri" am häufigsten bereitgestellt. Diesen Synonymlisten mangelt es daran, ähnliche Begriffe aufzeigen zu können: Sie vermögen lediglich andere Bezeichnungen auszuweisen.
Der Thesaurus wird in der Indexierung verwendet, um Indexterme zu vergeben. Dem Suchenden bietet der Thesaurus weitergehende Arten von Relationen, über die mit dem betreffenden Begriff in Beziehung stehende Begriffe gefunden werden können. Die Autorin nennt den Thesaurus ein Hilfsmittel, sich in Begriffsfeldern zurechtzufinden, dort zu navigieren.
Thesauri wurden benötigt, um bibliographischen Datensätzen Indexterme zuzuordnen, um die betreffenden Datensätze überhaupt nochmal wiederfinden zu können: Volltext fehlte, daher waren Indexterme absolut erforderlich und hohe Qualität bei der Vergabe der Indexterme geradezu zwingend.
Nicht jede Information ist digital verfügbar: das betrifft v.a. Texte aus Zeiten vor Erfindung des Computers. Aber auch heute noch erscheinen machne Publikationen ausschließlich als Printprodukte. - Die Autorin reduziert die verbleibende Daseinsberechtigung von Thesauri und Indexierung darauf, Zugang zu diesen nicht-digitalen Dokumenten zu ermöglichen.
Thesauri And Search Engines
Thesauri kommen sowohl beim Abrufen von Information als auch beim ("storage") zum Einsatz.
Die Autorin unterscheidet zwei Arten von Werkzeugen, die den Zugriff auf Volltexte ermöglichen: "exact-match (boolean)"-Suchsysteme und Statistik-basierte Suchsysteme. [wrs, pauschalisiert gesprochen:] Beide liefern in etwa dieselbe Zahl relevanter Treffer, doch ihre Ergebnismengen unterscheiden sich deutlich.
Use of Thesauri in Searching (1-5)
Bisher galt, das Thesauri eingesetzt wurden, um Terme zu erhalten: Der Indexierende für die Zuordnung (von Indextermen) zu Dokumenten, der Suchende für die Suche. Ob letzterer Zweck erfüllt/erreicht wird, erscheint zweifelhaft. Die Autorin führt Gründe an.
Thesauri werden von Suchenden zu selten genutzt. Die Autorin nennt als mögliche Ursache Unebenheiten, die auftreten, wenn man einen Thesaurus einsetzen will und schlägt als Gegenmaßnahme vor, diese Unebenheiten zu beseitigen. Die Autorin erwähnt eine Technik, einen Thesaurus dergestalt zu nutzen, dass der Recall zunimmt, ohne dass die Precision wesentlich darunter leidet. Die Autorin geht mit einem Absatz auf Endnutzer-Thesauri ein, die in Zshg. dieser DA aber vermutlich keine Rolle spielen werden.
Use of Thesauri in Searching (6+7)
Bis vor kurzem scheint man, nach Auffassung der Autorin, nicht erkannt zu haben, dass bei wachsender Volltext-Menge der Bedarf des Nutzers an Unterstützung und Navigation selbst dann wächst, wenn ein leistungsstarkes Suchwerkzeug bereitsteht.
Die Autorin erwähnt Semantische Netze als Ansatz, die Entwicklung von Enduser-Thesauri zu umgehen, zeigt aber gleichzeitig auf, dass dieser Ansatz die beabsichtigte Wirkung verfehlt hat.
(Quelle @ 20040604-05. _, Auszüge aus den Abschnitten "Introduction" bis "Use of Thesauri in Searching"; bereits paraphrasierte/exzerpierte Versionen dieser Abschnitte: Introduction (Abs. 1-6), Thesauri And Search Engines (Abs. 1+2), Use of Thesauri in Searching (Abs. 1-5, 6+7))
Posts mit dem Label Jessica Milstead werden angezeigt. Alle Posts anzeigen
Posts mit dem Label Jessica Milstead werden angezeigt. Alle Posts anzeigen
Freitag, Juni 04, 2004
Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Use of Thesauri in Searching, Abs.6+7
"Use of Thesauri in the Full-Text Environment", Abschnitt "Use of Thesauri in Searching"
Abs. 6
Endnutzer-Thesauri haben keine weite Verbreitung gefunden: Thesauri zu entwickeln, ist per se teuer. Dann noch einen Endnutzer-Thesaurus hinzuzufügen, würde weitere Kosten verursachen. - Gleichzeitig scheint man bis vor Kurzem nicht verstanden zu haben, dass bei wachsender Volltext-Menge auch der Bedarf des Nutzers an Unterstützung und Navigation auch dann wächst, wenn ein kraftvolles Suchwerkzeug bereitsteht.
Abs. 7
[so lala paraphrasiert] Ein semantisches Netz würde, nach Auffassung der Autorin, in etwa das Gleiche leisten wie ein Endnutzer-Thesaurus, aber ungefähr gleichteuer in der Entwicklung. Existierende semantische Netze, etwa WordNet, hat Retrieval-Ergebnisse nicht wesentlich verbessert, vielleicht - nach Ansicht der Autorin - deswegen nicht, weil der Fokus der betreffenden semantischen Netze nicht mit denen der Gruppe der Suchenden übereinstimmt. [/so lala paraphrasiert]
(Quelle @ 20040604-07. _, Abschnitt "Use of Thesauri in Searching", ...)
Abs. 6
Endnutzer-Thesauri haben keine weite Verbreitung gefunden: Thesauri zu entwickeln, ist per se teuer. Dann noch einen Endnutzer-Thesaurus hinzuzufügen, würde weitere Kosten verursachen. - Gleichzeitig scheint man bis vor Kurzem nicht verstanden zu haben, dass bei wachsender Volltext-Menge auch der Bedarf des Nutzers an Unterstützung und Navigation auch dann wächst, wenn ein kraftvolles Suchwerkzeug bereitsteht.
Abs. 7
[so lala paraphrasiert] Ein semantisches Netz würde, nach Auffassung der Autorin, in etwa das Gleiche leisten wie ein Endnutzer-Thesaurus, aber ungefähr gleichteuer in der Entwicklung. Existierende semantische Netze, etwa WordNet, hat Retrieval-Ergebnisse nicht wesentlich verbessert, vielleicht - nach Ansicht der Autorin - deswegen nicht, weil der Fokus der betreffenden semantischen Netze nicht mit denen der Gruppe der Suchenden übereinstimmt. [/so lala paraphrasiert]
(Quelle @ 20040604-07. _, Abschnitt "Use of Thesauri in Searching", ...)
Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Use of Thesauri in Searching, Abs. 1-5
"Use of Thesauri in the Full-Text Environment", Abschnitt "Use of Thesauri in Searching":
Abs. 1
In the traditional scenario, an indexer uses the thesaurus to select index terms for inclusion in the document record. Then the searcher, hopefully referring to the same thesaurus, selects terms which seem likely to produce relevant results, and searches the indexing, retrieving on the basis of exact match. Even if the searcher has not referred to the thesaurus, s/he is aided by the indexing because if the query words appear in the indexing, then all documents indexed with those words will be retrieved, whether the words happen to appear in the text or not.
Im traditionellen Szenario benutzt ein Indexer den Thesaurus, um Indexterme auszuwählen, die zu dem Dokumentdatensatz hinzugefügt werden sollen. Der Suchende, der sich hoffentlich (!) auf denselben Thesaurus bezieht, wählt Terme aus, die danach aussehen, relevante Ergenisse produzieren zu können, durchsucht das Indexierte und erhält ein Ergebnis auf Basis eines exakten Treffers. Selbst wenn der Suchende sich nicht auf den Thesaurus bezogen hat, erhält er durch die Indexierung Unterstützung, denn wenn die Suchwörter in der Indexierung erscheinen, dann werden alle Begriffe, die mit diesen Wörtern indexiert wurden, geliefert ("retrieved"), gleichgültig, ob die Wörter im Text erscheinen oder nicht.
[==] Herkömmlicherweise ordnet der Indexer einem Dokument Indexterme zu. Diese wählt er aus einem Thesaurus aus. - Der Suchende setzt einen Thesaurus ein, um Terme für die Suche zu erhalten. ...
Abs. 2
The basic design of thesauri to date, then, has been as indexing aids, with the expectation that searchers would be able to use these aids as a guide to searching. The notation used in term relationships is abstruse; the fact that "BT" and "NT" mean that two terms are related hierarchically is obvious only to specialists. Furthermore, database producers frequently do not mount their thesauri on their search systems. And even if the thesaurus is mounted, the search system may not support the full range of navigational information. In other words, the thesaurus is an indexing aid which we hope can also be used for searching, but we frequently haven't put much effort into making this use possible, let alone easy.
Die grundlegende Gestalt von Thesauri war bisher, Indexierungshilfen [zu geben], mit der Annahmne, dass Suchende fähig sein würden, diese Hilfen als Leitung/Führung durch die Suche zu nutzen. Die Notation, die in Begriffsrelationen verwendet wird, ist - nach Auffassung der Autorin - abstrus. Daß "OB" und "UB" bedeutet, dass zwei Begriffe in hierarchischer Beziehung zueinander stehen ist ausschließlich für Spezialisten offensichtlich. [wrs: 99% ACK!] Darüberhinaus bauen Datenbankhersteller ihre Thesauri häufig nicht in ihre Suchsysteme ein. Und selbst wenn der Thesaurus eingebaut ist, unterstützt das Suchsystem nicht den vollen Umfang navigationaler Information. Mit anderen Worten: Der Thesaurus ist eine Indexierungshilfe, von dem man hofft, dass sie auch für die Suche eingesetzt werden kann, aber häufig wird nicht allzu viel Aufwand darauf verwendet, dies auch wirklich zu ermöglichen.
[==] Der beabsichtigte Zweck von Thesauri war bisher zweigeteilt: Auf der einen Seite sollte er als Indexierungshilfe dienen, auf der anderen Seite dem Suchenden Suchbegriffe bieten. [Exzerpierfehler: Letzteres lässt sich aus obiger Übersetzung nicht herauslesen!] Praktisch erscheint letzterer Zweck [im Hinblick auf den Einsatz von Thesauri in Suchmaschinen] fraglich, da die verwendeten Kennungen nur Spezialisten geläufig sind, Datenbankhersteller ihre Thesauri häufig nicht in die Suchsysteme einbauen und falls doch, dann u.U. nur unvollständig unterstützen: Kennungen wie "OB"/"UB" zeigen ausschließlich dem Spezialisten, dass hiermit zwei in hierarchischer Relation zueinander stehende Begriffe gemeint sind (Ober- und Unterbegriff); unvollständige Unterstützung eines Thesaurus' im Suchsystem kann darauf hinauslaufen, dass nicht alle Relationstypen zur Verfügung stehen, obwohl sie im Thesaurus selbst enthalten sind.
Abs. 3
Thesauri are known to be underused by searchers; this is probably due at least partly to the fact that the thesaurus for a database is unlikely to be readily available to them. Even if it is available, it may be only in paper form, or as an online list with little or no user aid in the interface. Even without significant changes in the nature of the thesaurus itself, provision of effective thesaurus navigation tools in interfaces to search systems should increase searcher use substantially. Permitting the searcher to switch seamlessly between navigating the thesaurus and searching the database can only improve access.
Bekannt ist, dass Thesauri von Suchenden zu selten genutzt werden; dies liegt - laut der Autorin - vermutlich (!), wenigstens zumindest an dem Umstand, dass der Thesaurus einer DB ihnen wahrscheinlich (!) nicht direkt bereit steht. Selbst wenn er bereit steht, kann es sein, dass er lediglich in Papierform vorliegt oder als eine Online-Liste mit wenig oder gar keiner (Nutzer-)Unterstützung in der Benutzerschnittstelle. Selbst ohne signifikante Änderungen in der Natur des Thesaurus' selbst, sollte die Bereitstellung effektiver Thesaurus-Navigation-Tools in (Nutzer-)Schnittstellen zu Suchsystemen die Nutzung durch Suchende substanziell steigern. Dem Suchenden zu erlauben, ohne Bruch zwischen Thesaurus-Navigation und Datenbanksuche umzuschalten, kann den Zugriff nur verbessern.
[==] Thesauri werden von Suchenden zu selten benutzt. Ursache dafür könnte, wie auch die autorin vermutet, sein, dass dem Suchenden der Thesaurus nicht unmittelbar zugänglich ist, wobei zugänglich hier weit gefasst wird: Daneben, dass mglw. gar kein Thesaurus bereitsteht, könnte auch einer in Papierform vorliegen oder auch online, aber online eben nicht so weit aufbereitet, dass auch ein Nicht-Spezialist damit zurechtkommt.
Die Autorin ist der Auffassung, dass die Nutzung von Thesauri bei der Suche steigen könnte, wenn effektive Thesaurus-Navigation-Tools bereitgestellt würden, die dem Suchenden erlauben würden, ohne Bruch von der Thesaurus-Navigation zur Datenbank-Suche zu gelangen.
Abs. 4
An obvious way in which a thesaurus can be applied directly in retrieval is to use the relationships as a means of expanding the search. Research, however, has shown that these relationships must be used with caution. In general, expanding a search to include the narrower terms tends to improve recall without great sacrifice in precision. Expanding to include broader or related terms, while it does improve recall, typically has a significant negative impact on precision.
Ein offensichtlicher Weg, auf dem ein Thesaurus direkt im Retrieval eingesetzt werden kann, ist, die Relationen einzusetzen, um die Suche zu verbreitern. Die Forschung hat aber gezeigt, dass diese Relationen mit Vorsicht eingesetzt werden müssen. Generell tendiert, eine Suche um Unterbegriffe zu erweitern, dazu, den Recall zu verbessern, ohne dafür sonderlich viel Precision zu opfern. Verbreiterung, um Ober- oder verwandet Begriffe einzubeziehen, hat, obwohl es den Recall erhöht, üblicherweise signifikant negativen Einfluss auf die Precision.
[==] Ein Thesaurus kann im Retrieval eingesetzt werden, indem die dort definierten Relationen eingesetztw erden, um die Suche zu verbreitern. Forschungsergebnisse deuten aber darauf hin, dass hierbei Vorsicht zu walten hat: Unterbegriffe in die Suche einzubeziehen, erhöht den Recall, ohne die Precision wesentlich zu beeinträchtigen -- Ober- und verwandte Begriffe einzubeziehen, erhöht den Recall, senkt die Precision aber signifikant.
Abs. 5
Over the years there have been proposals for end-user thesauri designed specifically to facilitate searching. An end-user thesaurus differs from a conventional thesaurus in two primary ways: its term inclusion and organization, and its displays. It is designed to reflect and organize the total specialized vocabulary of users in a field, rather than to provide a limited list of authorized terms. It gives more information about the scope of terms, and its displays are designed around the way in which users approach information (Anderson & Rowley, 1992; Bates, 1990).
Über die Jahre gab es Vorschläge für Endnutzer-Thesauri, die speziell darauf zugeschnitten waren, die Suche zu erleichtern. Ein Endnutzer-Thesaurus unterscheidet sich von einem konventionellen Thesaurus auf zwei primäre Weisen: hinsichtlich seiner Term-Inkludierung und -Organisation, sowie hinsichtlich seiner Anzeige. Er ist darauf zugeschnitten, das gesamte spezialisierte Vokabular von Benutzern eines Bereiches widerzuspiegeln und zu organisieren, anstatt eine begrenzte Liste kompetenter ("authorized") Terme bereitzustellen. Er gibt mehr Information über den Umfang von Termen, und seine Anzeigen sind entlang der Weisen angeordnet, in denen Nutzer an Informationen herangehen.
[==] Es gab verschiedene Vorschläge von Endnutzer-Thesauri, die die Suche erleichtern sollten. Endnutzer-Thesauri unterscheiden sich von konventionellen Thesauri primär dadurch, wie sie Terme organisieren und ggf. inkludieren und dadurch, wie sie diese Terme anzeigen. Doch spiegelt er das Fachvokabular wider und organisiert es, anstatt es auf eine kleine Auswahl daraus zu beschränken. ...
Hier geht's zu sehr in Richtung Thesuari für Laien, anstatt Thesauri für Spezialisten (Infowissenschaftler), daher verfolge ich die Übersetzung/Paraphrasierung/Exzerpierung hier nicht weiter.
(Quelle @ 20040604-06.46, Abschnitt "Use of Thesauri in Searching", Abs. 1-5)
Abs. 1
In the traditional scenario, an indexer uses the thesaurus to select index terms for inclusion in the document record. Then the searcher, hopefully referring to the same thesaurus, selects terms which seem likely to produce relevant results, and searches the indexing, retrieving on the basis of exact match. Even if the searcher has not referred to the thesaurus, s/he is aided by the indexing because if the query words appear in the indexing, then all documents indexed with those words will be retrieved, whether the words happen to appear in the text or not.
Im traditionellen Szenario benutzt ein Indexer den Thesaurus, um Indexterme auszuwählen, die zu dem Dokumentdatensatz hinzugefügt werden sollen. Der Suchende, der sich hoffentlich (!) auf denselben Thesaurus bezieht, wählt Terme aus, die danach aussehen, relevante Ergenisse produzieren zu können, durchsucht das Indexierte und erhält ein Ergebnis auf Basis eines exakten Treffers. Selbst wenn der Suchende sich nicht auf den Thesaurus bezogen hat, erhält er durch die Indexierung Unterstützung, denn wenn die Suchwörter in der Indexierung erscheinen, dann werden alle Begriffe, die mit diesen Wörtern indexiert wurden, geliefert ("retrieved"), gleichgültig, ob die Wörter im Text erscheinen oder nicht.
[==] Herkömmlicherweise ordnet der Indexer einem Dokument Indexterme zu. Diese wählt er aus einem Thesaurus aus. - Der Suchende setzt einen Thesaurus ein, um Terme für die Suche zu erhalten. ...
Abs. 2
The basic design of thesauri to date, then, has been as indexing aids, with the expectation that searchers would be able to use these aids as a guide to searching. The notation used in term relationships is abstruse; the fact that "BT" and "NT" mean that two terms are related hierarchically is obvious only to specialists. Furthermore, database producers frequently do not mount their thesauri on their search systems. And even if the thesaurus is mounted, the search system may not support the full range of navigational information. In other words, the thesaurus is an indexing aid which we hope can also be used for searching, but we frequently haven't put much effort into making this use possible, let alone easy.
Die grundlegende Gestalt von Thesauri war bisher, Indexierungshilfen [zu geben], mit der Annahmne, dass Suchende fähig sein würden, diese Hilfen als Leitung/Führung durch die Suche zu nutzen. Die Notation, die in Begriffsrelationen verwendet wird, ist - nach Auffassung der Autorin - abstrus. Daß "OB" und "UB" bedeutet, dass zwei Begriffe in hierarchischer Beziehung zueinander stehen ist ausschließlich für Spezialisten offensichtlich. [wrs: 99% ACK!] Darüberhinaus bauen Datenbankhersteller ihre Thesauri häufig nicht in ihre Suchsysteme ein. Und selbst wenn der Thesaurus eingebaut ist, unterstützt das Suchsystem nicht den vollen Umfang navigationaler Information. Mit anderen Worten: Der Thesaurus ist eine Indexierungshilfe, von dem man hofft, dass sie auch für die Suche eingesetzt werden kann, aber häufig wird nicht allzu viel Aufwand darauf verwendet, dies auch wirklich zu ermöglichen.
[==] Der beabsichtigte Zweck von Thesauri war bisher zweigeteilt: Auf der einen Seite sollte er als Indexierungshilfe dienen, auf der anderen Seite dem Suchenden Suchbegriffe bieten. [Exzerpierfehler: Letzteres lässt sich aus obiger Übersetzung nicht herauslesen!] Praktisch erscheint letzterer Zweck [im Hinblick auf den Einsatz von Thesauri in Suchmaschinen] fraglich, da die verwendeten Kennungen nur Spezialisten geläufig sind, Datenbankhersteller ihre Thesauri häufig nicht in die Suchsysteme einbauen und falls doch, dann u.U. nur unvollständig unterstützen: Kennungen wie "OB"/"UB" zeigen ausschließlich dem Spezialisten, dass hiermit zwei in hierarchischer Relation zueinander stehende Begriffe gemeint sind (Ober- und Unterbegriff); unvollständige Unterstützung eines Thesaurus' im Suchsystem kann darauf hinauslaufen, dass nicht alle Relationstypen zur Verfügung stehen, obwohl sie im Thesaurus selbst enthalten sind.
Abs. 3
Thesauri are known to be underused by searchers; this is probably due at least partly to the fact that the thesaurus for a database is unlikely to be readily available to them. Even if it is available, it may be only in paper form, or as an online list with little or no user aid in the interface. Even without significant changes in the nature of the thesaurus itself, provision of effective thesaurus navigation tools in interfaces to search systems should increase searcher use substantially. Permitting the searcher to switch seamlessly between navigating the thesaurus and searching the database can only improve access.
Bekannt ist, dass Thesauri von Suchenden zu selten genutzt werden; dies liegt - laut der Autorin - vermutlich (!), wenigstens zumindest an dem Umstand, dass der Thesaurus einer DB ihnen wahrscheinlich (!) nicht direkt bereit steht. Selbst wenn er bereit steht, kann es sein, dass er lediglich in Papierform vorliegt oder als eine Online-Liste mit wenig oder gar keiner (Nutzer-)Unterstützung in der Benutzerschnittstelle. Selbst ohne signifikante Änderungen in der Natur des Thesaurus' selbst, sollte die Bereitstellung effektiver Thesaurus-Navigation-Tools in (Nutzer-)Schnittstellen zu Suchsystemen die Nutzung durch Suchende substanziell steigern. Dem Suchenden zu erlauben, ohne Bruch zwischen Thesaurus-Navigation und Datenbanksuche umzuschalten, kann den Zugriff nur verbessern.
[==] Thesauri werden von Suchenden zu selten benutzt. Ursache dafür könnte, wie auch die autorin vermutet, sein, dass dem Suchenden der Thesaurus nicht unmittelbar zugänglich ist, wobei zugänglich hier weit gefasst wird: Daneben, dass mglw. gar kein Thesaurus bereitsteht, könnte auch einer in Papierform vorliegen oder auch online, aber online eben nicht so weit aufbereitet, dass auch ein Nicht-Spezialist damit zurechtkommt.
Die Autorin ist der Auffassung, dass die Nutzung von Thesauri bei der Suche steigen könnte, wenn effektive Thesaurus-Navigation-Tools bereitgestellt würden, die dem Suchenden erlauben würden, ohne Bruch von der Thesaurus-Navigation zur Datenbank-Suche zu gelangen.
Abs. 4
An obvious way in which a thesaurus can be applied directly in retrieval is to use the relationships as a means of expanding the search. Research, however, has shown that these relationships must be used with caution. In general, expanding a search to include the narrower terms tends to improve recall without great sacrifice in precision. Expanding to include broader or related terms, while it does improve recall, typically has a significant negative impact on precision.
Ein offensichtlicher Weg, auf dem ein Thesaurus direkt im Retrieval eingesetzt werden kann, ist, die Relationen einzusetzen, um die Suche zu verbreitern. Die Forschung hat aber gezeigt, dass diese Relationen mit Vorsicht eingesetzt werden müssen. Generell tendiert, eine Suche um Unterbegriffe zu erweitern, dazu, den Recall zu verbessern, ohne dafür sonderlich viel Precision zu opfern. Verbreiterung, um Ober- oder verwandet Begriffe einzubeziehen, hat, obwohl es den Recall erhöht, üblicherweise signifikant negativen Einfluss auf die Precision.
[==] Ein Thesaurus kann im Retrieval eingesetzt werden, indem die dort definierten Relationen eingesetztw erden, um die Suche zu verbreitern. Forschungsergebnisse deuten aber darauf hin, dass hierbei Vorsicht zu walten hat: Unterbegriffe in die Suche einzubeziehen, erhöht den Recall, ohne die Precision wesentlich zu beeinträchtigen -- Ober- und verwandte Begriffe einzubeziehen, erhöht den Recall, senkt die Precision aber signifikant.
Abs. 5
Over the years there have been proposals for end-user thesauri designed specifically to facilitate searching. An end-user thesaurus differs from a conventional thesaurus in two primary ways: its term inclusion and organization, and its displays. It is designed to reflect and organize the total specialized vocabulary of users in a field, rather than to provide a limited list of authorized terms. It gives more information about the scope of terms, and its displays are designed around the way in which users approach information (Anderson & Rowley, 1992; Bates, 1990).
Über die Jahre gab es Vorschläge für Endnutzer-Thesauri, die speziell darauf zugeschnitten waren, die Suche zu erleichtern. Ein Endnutzer-Thesaurus unterscheidet sich von einem konventionellen Thesaurus auf zwei primäre Weisen: hinsichtlich seiner Term-Inkludierung und -Organisation, sowie hinsichtlich seiner Anzeige. Er ist darauf zugeschnitten, das gesamte spezialisierte Vokabular von Benutzern eines Bereiches widerzuspiegeln und zu organisieren, anstatt eine begrenzte Liste kompetenter ("authorized") Terme bereitzustellen. Er gibt mehr Information über den Umfang von Termen, und seine Anzeigen sind entlang der Weisen angeordnet, in denen Nutzer an Informationen herangehen.
[==] Es gab verschiedene Vorschläge von Endnutzer-Thesauri, die die Suche erleichtern sollten. Endnutzer-Thesauri unterscheiden sich von konventionellen Thesauri primär dadurch, wie sie Terme organisieren und ggf. inkludieren und dadurch, wie sie diese Terme anzeigen. Doch spiegelt er das Fachvokabular wider und organisiert es, anstatt es auf eine kleine Auswahl daraus zu beschränken. ...
Hier geht's zu sehr in Richtung Thesuari für Laien, anstatt Thesauri für Spezialisten (Infowissenschaftler), daher verfolge ich die Übersetzung/Paraphrasierung/Exzerpierung hier nicht weiter.
(Quelle @ 20040604-06.46, Abschnitt "Use of Thesauri in Searching", Abs. 1-5)
Labels:
Exzerpt,
Indexierung,
Information Retrieval,
Jessica Milstead,
Nutzen,
Thesaurus
Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Thesauri And Search Engines, Abs. 1+2
"Use of Thesauri in the Full-Text Environment", Abschnitt "Thesauri And Search Engines":
Abs. 1
Thesauri actually have a place at both ends of the information access process, at both storage and retrieval. The amount of electronically accessible full text is so immense, and is growing so fast, that users need all the help they can get in accessing it. The explosive growth of Web search engines, with their primitive algorithms, has had some rather unfortunate effects, to my mind. Some of these engines appear to have been developed by people who saw a need, but who had not the vaguest idea that there was already a history of development of tools to fulfill similar needs. There is little evidence that some of these developers had ever used either Dialog or a library catalog.
Tatsächlich haben Thesauri ihren Platz an beiden Enden des Prozesses des Informationszugriffs, beim Hinterlegen/Ablegen/Speichern und beim Retrieval. Die Menge elektronisch zugreifbaren Volltextes ist so immens und so schnell wachsend, dass Nutzer alle Hilfe benötigen, die sie bekommen können, um diese Menge von Volltext erreichen zu können. Das explosive Wachstum von Websuchmaschinen mit ihren primitiven Algorithmen hatten nach Meinung der Autorin ein paar ziemlich unglückliche Seiteneffekte: Einige dieser Maschinen scheinen, nach Ansicht der Autorin, von Leuten entwickelt worden zu sein, die einen Bedarf gesehen haben, die aber nicht die entfernteste Idee hatten, dass bereits eine Vergangenheit der Entwicklung von Werkezugen existierte, deren Ziel war, ähnliche Bedürfnisse zu decken. Es gibt wenig Anzeichen, daß irgendeiner dieser Entwickler jemals Dialog oder einen Bibliothekskatalog genutzt hat.
[==] Thesauri kommen sowohl beim Einlagern ("storage") als auch beim Abrufen von Informationen zum Einsatz. Die Autorin ist der Auffassung, dass die Entwickler der Websuchmaschinen nicht den Hauch einer Ahnung hatten, dass die Entwicklung von entsprechender (Wiederfinde-)Werkzeuge bereits eine lange Tradition hat.
Abs. 2
We should distinguish kinds of tools for facilitating access to full text on the basis of the attention they give to semantics. Older, exact-match (Boolean) systems give no attention to semantics. The search terms must appear in the document for it to be retrieved; if a term appears at all the document will be retrieved regardless of whether the term is important to the meaning of the document or not. Another approach relies on statistical information -- co-occurrence of words in the document, frequency, etc. Boolean and statistically-based systems have been found to have comparable retrieval performance, but to produce very different retrieval sets. That is, searches of the same database using a Boolean engine and a statistically-based one often produce about the same number of relevant hits, but there may be little overlap between the two sets of hits.
Auf Basis der Aufmerksamkeit, die sie der Semantik widmen, sollten wir (!) verschiedene Arten von Werkzeugen unterscheiden, die den Zugriff auf Volltexte erleichtern. Ältere buchstabengetreue boolsche Systeme ("exact-match (Boolean) systems") schenkten Semantik keine Aufmerksamkeit: Die Suchterme müssen in dem Dokument erscheinen, damit es geliefert ("retrieved") wird; wenn der Term in dem Dokument erscheint, wird das Dokument unabhängig davon geliefert, ob der Term wichtig für die Bedeutung des Dokumentes ist oder nicht. Ein anderer Ansatz vertraut auf statistische Information -- gemeinsames Auftreten von Wörtern im Dokument, Häufigkeit etc. Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben, dass sie aber sehr verschiedene Ergebnismengen produzieren, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen häufig zu Treffermengen mit etwa gleich vielen relevanten Treffern, doch die Trefermengen überschneiden einander nur geringfügig.
[==] Die Autorin schlägt vor, verschiedene Arten von Werkzeugen zu unterscheiden. Als Kriterium für die Differenzierung legt sie dabei die Aufmerksamkeit an, mit der verschiedene Werkzeuge die Semantik berücksichtigen: Exact-Match-Systeme schenken der Semantik keine Aufmerksamkeit (Treffer, wenn Wort im Text enthalten, unabhängig davon, ob dieser im Text überhaupt eine Rolle spielt), Statistik-basierte Systeme beachten [wrs: zumindest] gemeinsam auftretende Wörter, Häufigkeit von Wörtern u.a. "Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben" ("Boolean and statistically-based systems have been found to have comparable retrieval performance"), dass sie aber sehr verschiedene Ergebnismengen liefern, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen "häufig zu einer etwa gleich großen Anzahl relevanter Treffer" ("often [...] about the same number of relevant hits"), doch die Treffermengen selbst überschneiden einander nur geringfügig.
Abs. 3-5
./.
(Quelle @ 20040604-05. _, Abschnitt "Thesauri And Search Engines", ...)
Abs. 1
Thesauri actually have a place at both ends of the information access process, at both storage and retrieval. The amount of electronically accessible full text is so immense, and is growing so fast, that users need all the help they can get in accessing it. The explosive growth of Web search engines, with their primitive algorithms, has had some rather unfortunate effects, to my mind. Some of these engines appear to have been developed by people who saw a need, but who had not the vaguest idea that there was already a history of development of tools to fulfill similar needs. There is little evidence that some of these developers had ever used either Dialog or a library catalog.
Tatsächlich haben Thesauri ihren Platz an beiden Enden des Prozesses des Informationszugriffs, beim Hinterlegen/Ablegen/Speichern und beim Retrieval. Die Menge elektronisch zugreifbaren Volltextes ist so immens und so schnell wachsend, dass Nutzer alle Hilfe benötigen, die sie bekommen können, um diese Menge von Volltext erreichen zu können. Das explosive Wachstum von Websuchmaschinen mit ihren primitiven Algorithmen hatten nach Meinung der Autorin ein paar ziemlich unglückliche Seiteneffekte: Einige dieser Maschinen scheinen, nach Ansicht der Autorin, von Leuten entwickelt worden zu sein, die einen Bedarf gesehen haben, die aber nicht die entfernteste Idee hatten, dass bereits eine Vergangenheit der Entwicklung von Werkezugen existierte, deren Ziel war, ähnliche Bedürfnisse zu decken. Es gibt wenig Anzeichen, daß irgendeiner dieser Entwickler jemals Dialog oder einen Bibliothekskatalog genutzt hat.
[==] Thesauri kommen sowohl beim Einlagern ("storage") als auch beim Abrufen von Informationen zum Einsatz. Die Autorin ist der Auffassung, dass die Entwickler der Websuchmaschinen nicht den Hauch einer Ahnung hatten, dass die Entwicklung von entsprechender (Wiederfinde-)Werkzeuge bereits eine lange Tradition hat.
Abs. 2
We should distinguish kinds of tools for facilitating access to full text on the basis of the attention they give to semantics. Older, exact-match (Boolean) systems give no attention to semantics. The search terms must appear in the document for it to be retrieved; if a term appears at all the document will be retrieved regardless of whether the term is important to the meaning of the document or not. Another approach relies on statistical information -- co-occurrence of words in the document, frequency, etc. Boolean and statistically-based systems have been found to have comparable retrieval performance, but to produce very different retrieval sets. That is, searches of the same database using a Boolean engine and a statistically-based one often produce about the same number of relevant hits, but there may be little overlap between the two sets of hits.
Auf Basis der Aufmerksamkeit, die sie der Semantik widmen, sollten wir (!) verschiedene Arten von Werkzeugen unterscheiden, die den Zugriff auf Volltexte erleichtern. Ältere buchstabengetreue boolsche Systeme ("exact-match (Boolean) systems") schenkten Semantik keine Aufmerksamkeit: Die Suchterme müssen in dem Dokument erscheinen, damit es geliefert ("retrieved") wird; wenn der Term in dem Dokument erscheint, wird das Dokument unabhängig davon geliefert, ob der Term wichtig für die Bedeutung des Dokumentes ist oder nicht. Ein anderer Ansatz vertraut auf statistische Information -- gemeinsames Auftreten von Wörtern im Dokument, Häufigkeit etc. Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben, dass sie aber sehr verschiedene Ergebnismengen produzieren, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen häufig zu Treffermengen mit etwa gleich vielen relevanten Treffern, doch die Trefermengen überschneiden einander nur geringfügig.
[==] Die Autorin schlägt vor, verschiedene Arten von Werkzeugen zu unterscheiden. Als Kriterium für die Differenzierung legt sie dabei die Aufmerksamkeit an, mit der verschiedene Werkzeuge die Semantik berücksichtigen: Exact-Match-Systeme schenken der Semantik keine Aufmerksamkeit (Treffer, wenn Wort im Text enthalten, unabhängig davon, ob dieser im Text überhaupt eine Rolle spielt), Statistik-basierte Systeme beachten [wrs: zumindest] gemeinsam auftretende Wörter, Häufigkeit von Wörtern u.a. "Man hat erkannt, dass boolsche und Statistik-basierte Systeme eine vergleichbare Retrieval-Performance haben" ("Boolean and statistically-based systems have been found to have comparable retrieval performance"), dass sie aber sehr verschiedene Ergebnismengen liefern, d.h. beide Verfahren, angewandt auf dieselbe Datenbank, führen "häufig zu einer etwa gleich großen Anzahl relevanter Treffer" ("often [...] about the same number of relevant hits"), doch die Treffermengen selbst überschneiden einander nur geringfügig.
Abs. 3-5
./.
(Quelle @ 20040604-05. _, Abschnitt "Thesauri And Search Engines", ...)
Paraphrase/Exzerpt: Use of Thesauri in the Full-Text Environment: Introduction
"Use of Thesauri in the Full-Text Environment", Abschnitt "Introduction":
Abs. 1
IR hat sich i.d. jüngster Zeit durch die immens angewachsene Verfügbarkeit durchsuchbaren Volltextes - zzgl. der Suchmaschinen, die diesen Text durchsuchen können - dramatisch verändert. Daher stellt die Autorin sich die Frage, ob da [in dieser neuen IR-Umgebung] überhaupt noch Platz ist für Thesauri. Sie glaubt, dass da noch ein Platz für Thesauri - oder irgendwas in ihrer Art - ist, doch dass sie sich ändern müssen, damit sie wertvoll bleiben. Sie schränkt gleichzeitig ein, dass schwer vorherzusagen ist, welcher Art diese Änderungen sein müssen.
[==] IR hat sich durch die gewachsene Verfüg- und Durchsuchbarkeit immenser Mengen von Volltexten deutlich geändert. Die Autorin ist der Auffassung, dass Thesauri in diesem Kontext ihre Daseinsberechtigung nicht eingebüßt haben, aber verändert werden müssen, damit sie wertvoll bleiben. Welcher Art diese Änderungen sein müssen, nennt sie "schwer vorhersagbar" ("hard to predict").
Abs. 2
Die Autorin nennt einen Thesaurus "mehr als eine simple" Synonymliste, wobei sie statt des Terms "Synonym" lediglich "equivalence" verwendet ("more than a simple equivalence list"). Dieser Art "Thesaurus" wird von Textretrieval-Systemen am häufigsten bereitgestellt und ist "lebenswichtig" ("vital") für das effektive IR, aber nicht genug, da sie lediglich dazu geeignet seien, Begriffe auszudrücken, "die man schon im Kopf hat" ("which is already in the user's mind"), dem Nutzer aber keine Begriffe aufzeigen, die zu dem bereits bekannten in Bezug stehen -- die aber bei der Suche wertvoll sein könnten.
[==] Die Autorin hält "Thesauri" im Sinne von Synonymwörterbüchern für nicht ausreichend für das IR, da solche lediglich dazu geeignet seien, bereits bekannte Begriffe anders auszudrücken, nicht aber dazu, mit diesen Begriffen in Vbdg. stehende andere Begriffe zu finden. Diese anderen Begriffe aber könnten bei der Suche hilfreich sein.
Abs. 3
Ein echter Thesaurus bietet neben Synonymrealtionen auch andere Arten von Relationen, z.B. genus-species, und bietet "navigationale" Unterstützung durch Angaben zum Gültigkeitsbereich (Synonymzusätze?) und andere Hilfen. Die Autorin nennt einen Thesaurus ein Werkzeug, das dazu gedacht ist, Nutzern dabei zu helfen, ihren Weg durch Begriffsdatenbanken ("vocabulary databases") zu finden. Zusätzlich zu seiner herkömmlichen Anwendung als eine Instanz ("authority") für Terme, die bei der Indexierung der DB verwendet werden/zum Einsatz kommen, erinnert er den Nutzer an Terme, die er mglw. nicht bedacht hat.
[==] Bei der Indexierung wird der Thesaurus genutzt, um Indexterme zu vergeben. Dem (abfragenden) Nutzer bietet er (der Thesaurus), durch über die Synonymrelation hinausgehende Arten von Relationen, Hinweise auf weitere, bei der Suche potenziell nützliche Begriffe - und Terme. Die Autorin nennt den Thesaurus ein Werkzeug, das dazu gedacht ist, Nutzer darin zu unterstützen, durch Begriffsdatenbanken ("vocabulary databases") zu navigieren, d.h. um sich in Begriffsfeldern zurechtzufinden.
Abs. 4
The ANSI/NISO standard for thesauri (National Information Standards Organization, 1994) provides the best available information on what thesauri should do and how they should be built, but it predates the recent explosion of full text and powerful search engines, and it is not an adequate guide to future needs and potential.
Der ANSI/NISO-Standard für Thesauri bietet, laut der Autorin, die beste Information darüber, was Thesauri leisten sollen und wie sie erstellt werden sollen. Aber dieser Standard datiert die jüngste Explosion von Volltext und kraftvollen Suchmaschinen, und er ist kein adäquater Leitfaden für zukünftige Bedürfnisse und Potenzial.
[==] Laut der Autorin ist der ANSI/NISO-Standard für Thesauri die beste Informationsquelle dafür, was Thesauri leisten sollen und wie sie erstellt werden sollen, ist aber, nach Ansicht der Autorin, kein adäquater Leitfaden im Hinblick auf zukünftigen Bedarf und Potenzial...
Abs. 5
The first thesauri were produced before electronic searching became widely available, but their full development coincided with the growth of online bibliographic databases. The earliest electronic files consisted only of titles, bibliographic descriptions, and indexing; if you were lucky there were abstracts, but this was not to be taken for granted when storage space was a very precious commodity and acquiring anything in electronic form generally meant rekeying it. In this environment, indexing had to be of high quality if information was to be retrieved at all. Hence the obvious need for thesauri.
[==] Die ersten Thesauri entstanden, ehe digitales Suchen weitverbreitet war. Ihre Ausgestaltung vollzog sich zu Zeiten, in denen bibliographische Online-Datenbanken wuchsen. In dieser Zeit war Massenspeicher teuer und, Abstracts aufzunehmen, implizierte, dass diese abgetippt werden mussten. Daraus entstand der Bedarf nach Thesauri: Abstracts waren selten, und wenn man die Datensätze überhaupt nochmal wiederfinden wolle, musste die Indexierung von hoher Qualität sein. [wrs: Selten vorkommende Stichwörter hätte man vermutlich sehr selten überhaupt für die Suche verwendet, bei häufig vorkommenden Stichwörtern hätte man leicht einen riesigen Recall erhalten können, in dem die eigentlich interessanten Treffer untergehen konnten - so wie man heute bei Ergebnissen der Suchmaschinen spätestens nach Seite 3 der den Rest der Trefferliste verwirft.]
Abs.6
Today it is beginning to seem as if all information is available in full text. However, this is not true, nor will it be true in the immediate future. Vast numbers of legacy documents remain, and converting these to searchable text is an expensive, long-term proposition. Furthermore, many documents are still being produced only in printed form. Therefore, thesauri and indexing will continue to have a place at least for awhile in facilitating access to documents for which electronic text is not available. Their long-run value, however, depends on integration with full-text search.
Heutzutage beginnt der Eindruck zu entstehen, als ob alle Information als Volltext verfügbar wäre. Tatsächlich ist dies nicht wahr [nicht der Fall], es auch wird es nicht [auch nicht] in nächster Zukunft nicht wahr [der Fall] sein: Gewaltige Mengen von alter Dokumente ("legacy documents") [nicht-digitaler Dokumente] bleiben übrig ("remain"), und diese zu konvertieren, ist ein teures, langwieriges Geschäft. Abgesehen davon werden [auch heute] noch zahlreiche Dokumente ausschließlich in gedruckter Form produziert. Daher werden Thesauri und Indexierung - zumindest für eine Weile - noch einen Platz darin, den Zugriff auf Dokumente zu unterstützen, für die elektronischer Text nicht vorliegt. Allerdings hängt ihr langfristiger Wert davon ab, wie sehr sie mit Volltextsuche integrieren.
Diese Position war mir von anderen Autoren bislang nicht bekannt.
[==] Allmählich entwickelt sich der Eindruck, jede Information wäre als digitaler Volltext vefügbar - doch dieser Eindruck trügt, und daran wird sich auch in naher Zukunft nichts ändern: Es existieren gewaltige Mengen von Text, die niemals in digitaler Form erschienen sind - etwa Dokumente aus Zeiten vor Erfindung des Computers. Daneben erscheinen noch heute zahlreiche Dokumente ausschließlich in gedruckter Form. Entsprechend haben, laut der Autorin, Thesauri und Indexierung zumindest noch für eine Weile eine Daseinsberechtigung darin, den Zugang zu solchen Dokumenten zu erleichtern, die eben nicht als Volltext vorliegen. Dabei macht die Autorin den langfristigen Wert beider davon abhängig, wie sehr sie mit der Volltextsuche integrieren. [wrs: Beachtenswert finde ich in diesem Zusammenhang, dass die Autorin Volltextsuche anscheinend als unabhängig von einer Indexierung betrachtet. - Meiner Meinung nach ist Indexierung wesentlicher Bestandteil auch der Volltextsuche: SQL - Standardabfragesprache auch moderner Datenbanken - stellt immer noch eine Mglk. bereit, einen Index über Tabellen der DB zu erstellen -- IMHO, aber noch nicht belegt, weil dadurch die Abfrage beschleunigt werden kann. Ohne Indexierung wäre IMO eine sequenzielle Suche erforderlich, die bis heute merklich langsamer ist als die über einen Index. -- Wobei sich letzlich kaum ausschließen lässt, dass durch immer schneller werdende Hardware irgendwann die Situation entsteht, dass ein Nutzer zwischen einer sequenziellen Suche und einer Suche vermittels eines Index'keinen Unterschied mehr bemerkt. Wie gesagt: IMO]
(Quelle @ 20040604-03.14..04.51, Abschnitt "Introduction", alle Absätze)
Abs. 1
IR hat sich i.d. jüngster Zeit durch die immens angewachsene Verfügbarkeit durchsuchbaren Volltextes - zzgl. der Suchmaschinen, die diesen Text durchsuchen können - dramatisch verändert. Daher stellt die Autorin sich die Frage, ob da [in dieser neuen IR-Umgebung] überhaupt noch Platz ist für Thesauri. Sie glaubt, dass da noch ein Platz für Thesauri - oder irgendwas in ihrer Art - ist, doch dass sie sich ändern müssen, damit sie wertvoll bleiben. Sie schränkt gleichzeitig ein, dass schwer vorherzusagen ist, welcher Art diese Änderungen sein müssen.
[==] IR hat sich durch die gewachsene Verfüg- und Durchsuchbarkeit immenser Mengen von Volltexten deutlich geändert. Die Autorin ist der Auffassung, dass Thesauri in diesem Kontext ihre Daseinsberechtigung nicht eingebüßt haben, aber verändert werden müssen, damit sie wertvoll bleiben. Welcher Art diese Änderungen sein müssen, nennt sie "schwer vorhersagbar" ("hard to predict").
Abs. 2
Die Autorin nennt einen Thesaurus "mehr als eine simple" Synonymliste, wobei sie statt des Terms "Synonym" lediglich "equivalence" verwendet ("more than a simple equivalence list"). Dieser Art "Thesaurus" wird von Textretrieval-Systemen am häufigsten bereitgestellt und ist "lebenswichtig" ("vital") für das effektive IR, aber nicht genug, da sie lediglich dazu geeignet seien, Begriffe auszudrücken, "die man schon im Kopf hat" ("which is already in the user's mind"), dem Nutzer aber keine Begriffe aufzeigen, die zu dem bereits bekannten in Bezug stehen -- die aber bei der Suche wertvoll sein könnten.
[==] Die Autorin hält "Thesauri" im Sinne von Synonymwörterbüchern für nicht ausreichend für das IR, da solche lediglich dazu geeignet seien, bereits bekannte Begriffe anders auszudrücken, nicht aber dazu, mit diesen Begriffen in Vbdg. stehende andere Begriffe zu finden. Diese anderen Begriffe aber könnten bei der Suche hilfreich sein.
Abs. 3
Ein echter Thesaurus bietet neben Synonymrealtionen auch andere Arten von Relationen, z.B. genus-species, und bietet "navigationale" Unterstützung durch Angaben zum Gültigkeitsbereich (Synonymzusätze?) und andere Hilfen. Die Autorin nennt einen Thesaurus ein Werkzeug, das dazu gedacht ist, Nutzern dabei zu helfen, ihren Weg durch Begriffsdatenbanken ("vocabulary databases") zu finden. Zusätzlich zu seiner herkömmlichen Anwendung als eine Instanz ("authority") für Terme, die bei der Indexierung der DB verwendet werden/zum Einsatz kommen, erinnert er den Nutzer an Terme, die er mglw. nicht bedacht hat.
[==] Bei der Indexierung wird der Thesaurus genutzt, um Indexterme zu vergeben. Dem (abfragenden) Nutzer bietet er (der Thesaurus), durch über die Synonymrelation hinausgehende Arten von Relationen, Hinweise auf weitere, bei der Suche potenziell nützliche Begriffe - und Terme. Die Autorin nennt den Thesaurus ein Werkzeug, das dazu gedacht ist, Nutzer darin zu unterstützen, durch Begriffsdatenbanken ("vocabulary databases") zu navigieren, d.h. um sich in Begriffsfeldern zurechtzufinden.
Abs. 4
The ANSI/NISO standard for thesauri (National Information Standards Organization, 1994) provides the best available information on what thesauri should do and how they should be built, but it predates the recent explosion of full text and powerful search engines, and it is not an adequate guide to future needs and potential.
Der ANSI/NISO-Standard für Thesauri bietet, laut der Autorin, die beste Information darüber, was Thesauri leisten sollen und wie sie erstellt werden sollen. Aber dieser Standard datiert die jüngste Explosion von Volltext und kraftvollen Suchmaschinen, und er ist kein adäquater Leitfaden für zukünftige Bedürfnisse und Potenzial.
[==] Laut der Autorin ist der ANSI/NISO-Standard für Thesauri die beste Informationsquelle dafür, was Thesauri leisten sollen und wie sie erstellt werden sollen, ist aber, nach Ansicht der Autorin, kein adäquater Leitfaden im Hinblick auf zukünftigen Bedarf und Potenzial...
Abs. 5
The first thesauri were produced before electronic searching became widely available, but their full development coincided with the growth of online bibliographic databases. The earliest electronic files consisted only of titles, bibliographic descriptions, and indexing; if you were lucky there were abstracts, but this was not to be taken for granted when storage space was a very precious commodity and acquiring anything in electronic form generally meant rekeying it. In this environment, indexing had to be of high quality if information was to be retrieved at all. Hence the obvious need for thesauri.
[==] Die ersten Thesauri entstanden, ehe digitales Suchen weitverbreitet war. Ihre Ausgestaltung vollzog sich zu Zeiten, in denen bibliographische Online-Datenbanken wuchsen. In dieser Zeit war Massenspeicher teuer und, Abstracts aufzunehmen, implizierte, dass diese abgetippt werden mussten. Daraus entstand der Bedarf nach Thesauri: Abstracts waren selten, und wenn man die Datensätze überhaupt nochmal wiederfinden wolle, musste die Indexierung von hoher Qualität sein. [wrs: Selten vorkommende Stichwörter hätte man vermutlich sehr selten überhaupt für die Suche verwendet, bei häufig vorkommenden Stichwörtern hätte man leicht einen riesigen Recall erhalten können, in dem die eigentlich interessanten Treffer untergehen konnten - so wie man heute bei Ergebnissen der Suchmaschinen spätestens nach Seite 3 der den Rest der Trefferliste verwirft.]
Abs.6
Today it is beginning to seem as if all information is available in full text. However, this is not true, nor will it be true in the immediate future. Vast numbers of legacy documents remain, and converting these to searchable text is an expensive, long-term proposition. Furthermore, many documents are still being produced only in printed form. Therefore, thesauri and indexing will continue to have a place at least for awhile in facilitating access to documents for which electronic text is not available. Their long-run value, however, depends on integration with full-text search.
Heutzutage beginnt der Eindruck zu entstehen, als ob alle Information als Volltext verfügbar wäre. Tatsächlich ist dies nicht wahr [nicht der Fall], es auch wird es nicht [auch nicht] in nächster Zukunft nicht wahr [der Fall] sein: Gewaltige Mengen von alter Dokumente ("legacy documents") [nicht-digitaler Dokumente] bleiben übrig ("remain"), und diese zu konvertieren, ist ein teures, langwieriges Geschäft. Abgesehen davon werden [auch heute] noch zahlreiche Dokumente ausschließlich in gedruckter Form produziert. Daher werden Thesauri und Indexierung - zumindest für eine Weile - noch einen Platz darin, den Zugriff auf Dokumente zu unterstützen, für die elektronischer Text nicht vorliegt. Allerdings hängt ihr langfristiger Wert davon ab, wie sehr sie mit Volltextsuche integrieren.
Diese Position war mir von anderen Autoren bislang nicht bekannt.
[==] Allmählich entwickelt sich der Eindruck, jede Information wäre als digitaler Volltext vefügbar - doch dieser Eindruck trügt, und daran wird sich auch in naher Zukunft nichts ändern: Es existieren gewaltige Mengen von Text, die niemals in digitaler Form erschienen sind - etwa Dokumente aus Zeiten vor Erfindung des Computers. Daneben erscheinen noch heute zahlreiche Dokumente ausschließlich in gedruckter Form. Entsprechend haben, laut der Autorin, Thesauri und Indexierung zumindest noch für eine Weile eine Daseinsberechtigung darin, den Zugang zu solchen Dokumenten zu erleichtern, die eben nicht als Volltext vorliegen. Dabei macht die Autorin den langfristigen Wert beider davon abhängig, wie sehr sie mit der Volltextsuche integrieren. [wrs: Beachtenswert finde ich in diesem Zusammenhang, dass die Autorin Volltextsuche anscheinend als unabhängig von einer Indexierung betrachtet. - Meiner Meinung nach ist Indexierung wesentlicher Bestandteil auch der Volltextsuche: SQL - Standardabfragesprache auch moderner Datenbanken - stellt immer noch eine Mglk. bereit, einen Index über Tabellen der DB zu erstellen -- IMHO, aber noch nicht belegt, weil dadurch die Abfrage beschleunigt werden kann. Ohne Indexierung wäre IMO eine sequenzielle Suche erforderlich, die bis heute merklich langsamer ist als die über einen Index. -- Wobei sich letzlich kaum ausschließen lässt, dass durch immer schneller werdende Hardware irgendwann die Situation entsteht, dass ein Nutzer zwischen einer sequenziellen Suche und einer Suche vermittels eines Index'keinen Unterschied mehr bemerkt. Wie gesagt: IMO]
(Quelle @ 20040604-03.14..04.51, Abschnitt "Introduction", alle Absätze)
Dienstag, Juni 01, 2004
beantwortet: Welchen Zweck hat das Konzept Thesaurus? Weswegen - mit welcher Absicht - werden Thesauri
Welchen Zweck hat das Konzept Thesaurus? Weswegen - mit welcher Absicht - werden Thesauri eingesetzt?
Thesauri werden hauptsächlich bei der Recherche, in der Dokumentation und in der Lehre eingesetzt.
Bei der Recherche werden Thesauri sowohl beim Hinterlegen von Dokumenten als auch bei deren Abruf eingesetzt. – Unter "Hinterlegen" fallen z.B. das Hinzufügen eines Dokumentes zu einer Fachinformations- oder bibliographischen Datenbank, etwa zu einem Bibliothekskatalog. Beim Hinterlegen kann ein Thesaurus dazu genutzt werden, Indexterme auszuwählen, die dem Dokument zugeordnet werden. "Abruf" meint hier die Recherche sowie das Retrieval. Beim Abruf kann ein Thesaurus vom Recherchierenden dazu genutzt werden, Terme nachzuschlagen, um damit zu recherchieren. Der Thesaurus kann ihn dabei dadurch unterstützen, dass er von Nicht-Deskriptoren auf Deskriptoren verweist und Hinweise auf ähnliche Terme gibt, etwa Benennungen von Ober-, Unter-, nebengeordneten oder verwandten Begriffen. "In addition to its traditional use as an authority for the terms used in indexing the database, it offers reminders of terms the user might not even have considered." (Quelle: Use of Thesauri in the Full-Text Environment, Abs. 3, letzter Satz). Dies wird auch in dem Bericht zum Thesaurus der Deutsche Post World Net unter "3. The need for a global thesaurus" vermerkt: "4. Intranet: need for indexing documents"
In der Dokumentation werden Thesauri zu mindestens zwei verschiedenen Zwecken eingesetzt: Einmal, um innerhalb einer gesamten Organisation für denselben Gegenstand dieselbe Benennung zu verwenden, zum anderen, um innerhalb von Produktbeschreibungen und Bedienungsanleitungen denselben Gegenstand stets identisch zu bennenen1). Der Vortrag Bericht zum Thesaurus der Deutsche Post World Net ("Building a multilingual company thesaurus. Distributed developement based on IC INDEX. Project reported: Deutsche Post World Net") unterstreicht dies in Bezug auf die Organisation-weit einheitliche Benennung identischer Gegenstände (auf Seite 6, Nummer 3): "unified language: vital for all kind of face-to-face communication and the communication supported by technical means."
In der Lehre werden Thesauri eingesetzt, um den Umgang damit einzuüben – etwa, um das Indexieren zu üben: "Aufgabenstellung: (...) Inhaltliche Erschließung der Titel durch Deskripto-ren aus dem Infodata-Thesaurus." (Quelle: Laborpraktikum Bibliographische Software, Gestaltung von Retrievalsystemen, OPACs SS 20042), Seite 1, Absatz 2, Satz 2.)
1) Das wurde irgendwann mal innerhalb eines Leuchtturm-Projektes "dargeboten". -> Quelle besorgen!
2) lokal von 20040606-08.22: Arbeitsplan_SS_2004.pdf
Recherche-Ergebnisse zu Thesaurus allgemein, Thesaurus-(Management-)Softwares
Thesauri werden hauptsächlich bei der Recherche, in der Dokumentation und in der Lehre eingesetzt.
Bei der Recherche werden Thesauri sowohl beim Hinterlegen von Dokumenten als auch bei deren Abruf eingesetzt. – Unter "Hinterlegen" fallen z.B. das Hinzufügen eines Dokumentes zu einer Fachinformations- oder bibliographischen Datenbank, etwa zu einem Bibliothekskatalog. Beim Hinterlegen kann ein Thesaurus dazu genutzt werden, Indexterme auszuwählen, die dem Dokument zugeordnet werden. "Abruf" meint hier die Recherche sowie das Retrieval. Beim Abruf kann ein Thesaurus vom Recherchierenden dazu genutzt werden, Terme nachzuschlagen, um damit zu recherchieren. Der Thesaurus kann ihn dabei dadurch unterstützen, dass er von Nicht-Deskriptoren auf Deskriptoren verweist und Hinweise auf ähnliche Terme gibt, etwa Benennungen von Ober-, Unter-, nebengeordneten oder verwandten Begriffen. "In addition to its traditional use as an authority for the terms used in indexing the database, it offers reminders of terms the user might not even have considered." (Quelle: Use of Thesauri in the Full-Text Environment, Abs. 3, letzter Satz). Dies wird auch in dem Bericht zum Thesaurus der Deutsche Post World Net unter "3. The need for a global thesaurus" vermerkt: "4. Intranet: need for indexing documents"
In der Dokumentation werden Thesauri zu mindestens zwei verschiedenen Zwecken eingesetzt: Einmal, um innerhalb einer gesamten Organisation für denselben Gegenstand dieselbe Benennung zu verwenden, zum anderen, um innerhalb von Produktbeschreibungen und Bedienungsanleitungen denselben Gegenstand stets identisch zu bennenen1). Der Vortrag Bericht zum Thesaurus der Deutsche Post World Net ("Building a multilingual company thesaurus. Distributed developement based on IC INDEX. Project reported: Deutsche Post World Net") unterstreicht dies in Bezug auf die Organisation-weit einheitliche Benennung identischer Gegenstände (auf Seite 6, Nummer 3): "unified language: vital for all kind of face-to-face communication and the communication supported by technical means."
In der Lehre werden Thesauri eingesetzt, um den Umgang damit einzuüben – etwa, um das Indexieren zu üben: "Aufgabenstellung: (...) Inhaltliche Erschließung der Titel durch Deskripto-ren aus dem Infodata-Thesaurus." (Quelle: Laborpraktikum Bibliographische Software, Gestaltung von Retrievalsystemen, OPACs SS 20042), Seite 1, Absatz 2, Satz 2.)
1) Das wurde irgendwann mal innerhalb eines Leuchtturm-Projektes "dargeboten". -> Quelle besorgen!
2) lokal von 20040606-08.22: Arbeitsplan_SS_2004.pdf
Recherche-Ergebnisse zu Thesaurus allgemein, Thesaurus-(Management-)Softwares
Sonntag, Mai 30, 2004
Der Nutzen von Thesauri
...wird beschrieben in Use of Thesauri in the Full-Text Environment, sowie, kürzer, in About Thesauri.
Recherche-Ergebnisse zu Thesaurus allgemein, Thesaurus-(Management-)Softwares
Recherche-Ergebnisse zu Thesaurus allgemein, Thesaurus-(Management-)Softwares