Search (90 results, page 1 of 5)

Medien-Informationsmanagement : Archivarische, dokumentarische, betriebswirtschaftliche, rechtliche und Berufsbild-Aspekte ; [Frühjahrstagung der Fachgruppe 7 im Jahr 2000 in Weimar und Folgetagung 2001 in Köln] (2003) 0.03
```
0.027410198 = product of:
  0.113556534 = sum of:
    0.04585412 = weight(_text_:allgemeines in 1833) [ClassicSimilarity], result of:
      0.04585412 = score(doc=1833,freq=8.0), product of:
        0.12123675 = queryWeight, product of:
          5.705423 = idf(docFreq=399, maxDocs=44218)
          0.02124939 = queryNorm
        0.37821966 = fieldWeight in 1833, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          5.705423 = idf(docFreq=399, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.015225129 = weight(_text_:buch in 1833) [ClassicSimilarity], result of:
      0.015225129 = score(doc=1833,freq=2.0), product of:
        0.09879628 = queryWeight, product of:
          4.64937 = idf(docFreq=1149, maxDocs=44218)
          0.02124939 = queryNorm
        0.1541063 = fieldWeight in 1833, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.64937 = idf(docFreq=1149, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.019571815 = weight(_text_:und in 1833) [ClassicSimilarity], result of:
      0.019571815 = score(doc=1833,freq=64.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.41556883 = fieldWeight in 1833, product of:
          8.0 = tf(freq=64.0), with freq of:
            64.0 = termFreq=64.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.013230941 = weight(_text_:des in 1833) [ClassicSimilarity], result of:
      0.013230941 = score(doc=1833,freq=12.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.22483975 = fieldWeight in 1833, product of:
          3.4641016 = tf(freq=12.0), with freq of:
            12.0 = termFreq=12.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.013230941 = weight(_text_:des in 1833) [ClassicSimilarity], result of:
      0.013230941 = score(doc=1833,freq=12.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.22483975 = fieldWeight in 1833, product of:
          3.4641016 = tf(freq=12.0), with freq of:
            12.0 = termFreq=12.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.0021250895 = product of:
      0.004250179 = sum of:
        0.004250179 = weight(_text_:1 in 1833) [ClassicSimilarity], result of:
          0.004250179 = score(doc=1833,freq=2.0), product of:
            0.05219918 = queryWeight, product of:
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.02124939 = queryNorm
            0.08142233 = fieldWeight in 1833, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.0234375 = fieldNorm(doc=1833)
      0.5 = coord(1/2)
    0.004318498 = product of:
      0.008636996 = sum of:
        0.008636996 = weight(_text_:22 in 1833) [ClassicSimilarity], result of:
          0.008636996 = score(doc=1833,freq=2.0), product of:
            0.07441174 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02124939 = queryNorm
            0.116070345 = fieldWeight in 1833, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.0234375 = fieldNorm(doc=1833)
      0.5 = coord(1/2)
  0.2413793 = coord(7/29)
```
Abstract

Als in den siebziger Jahren des vergangenen Jahrhunderts immer häufiger die Bezeichnung Informationsmanager für Leute propagiert wurde, die bis dahin als Dokumentare firmierten, wurde dies in den etablierten Kreisen der Archivare und Bibliothekare gelegentlich belächelt und als Zeichen einer Identitätskrise oder jedenfalls einer Verunsicherung des damit überschriebenen Berufsbilds gewertet. Für den Berufsstand der Medienarchivare/Mediendokumentare, die sich seit 1960 in der Fachgruppe 7 des Vereins, später Verbands deutscher Archivare (VdA) organisieren, gehörte diese Verortung im Zeichen neuer inhaltlicher Herausforderungen (Informationsflut) und Technologien (EDV) allerdings schon früh zu den Selbstverständlichkeiten des Berufsalltags. "Halt, ohne uns geht es nicht!" lautete die Überschrift eines Artikels im Verbandsorgan "Info 7", der sich mit der Einrichtung von immer mächtigeren Leitungsnetzen und immer schnelleren Datenautobahnen beschäftigte. Information, Informationsgesellschaft: diese Begriffe wurden damals fast nur im technischen Sinne verstanden. Die informatisierte, nicht die informierte Gesellschaft stand im Vordergrund - was wiederum Kritiker auf den Plan rief, von Joseph Weizenbaum in den USA bis hin zu den Informations-Ökologen in Bremen. Bei den nationalen, manchmal auch nur regionalen Projekten und Modellversuchen mit Datenautobahnen - auch beim frühen Btx - war nie so recht deutlich geworden, welche Inhalte in welcher Gestalt durch diese Netze und Straßen gejagt werden sollten und wer diese Inhalte eigentlich selektieren, portionieren, positionieren, kurz: managen sollte. Spätestens mit dem World Wide Web sind diese Projekte denn auch obsolet geworden, jedenfalls was die Hardware und Software anging. Geblieben ist das Thema Inhalte (neudeutsch: Content). Und - immer drängender im nicht nur technischen Verständnis - das Thema Informationsmanagement. MedienInformationsManagement war die Frühjahrstagung der Fachgruppe 7 im Jahr 2000 in Weimar überschrieben, und auch die Folgetagung 2001 in Köln, die der multimedialen Produktion einen dokumentarischen Pragmatismus gegenüber stellte, handelte vom Geschäftsfeld Content und von Content-Management-Systemen. Die in diesem 6. Band der Reihe Beiträge zur Mediendokumentation versammelten Vorträge und Diskussionsbeiträge auf diesen beiden Tagungen beleuchten das Titel-Thema aus den verschiedensten Blickwinkeln: archivarischen, dokumentarischen, kaufmännischen, berufsständischen und juristischen. Deutlich wird dabei, daß die Berufsbezeichnung Medienarchivarln/Mediendokumentarln ziemlich genau für all das steht, was heute mit sog. alten wie neuen Medien im organisatorischen, d.h. ordnenden und vermittelnden Sinne geschieht. Im besonderen Maße trifft dies auf das Internet und die aus ihm geborenen Intranets zu. Beide bedürfen genauso der ordnenden Hand, die sich an den alten Medien, an Buch, Zeitung, Tonträger, Film etc. geschult hat, denn sie leben zu großen Teilen davon. Daß das Internet gleichwohl ein Medium sui generis ist und die alten Informationsberufe vor ganz neue Herausforderungen stellt - auch das durchzieht die Beiträge von Weimar und Köln.
Vorliegender Band umgreift den gegenwärtigen Stand der Diskussion um das Handling von Informationen in und mit Hilfe von neuen und alten Medien und liefert außerdem dem Verein Fortbildung für Medienarchivare/ Mediendokumentare (VFM), der seit dem 5. Band die Reihe herausgibt, eine weitere Handreichung für die zusammen mit dem Deutschen Institut, für publizistische Bildungsarbeit in Hagen veranstalteten Seminare. Im Anhang sind außer den vollständigen Programmen der beiden Frühjahrstagungen die Namen und institutionellen Anbindungen der Referenten nachzulesen. Allen Autoren des Bandes sei für ihre Bereitschaft, an dieser Publikation mitzuwirken, gedankt, insbesondere denen, die sich auch noch der Mühe unterziehen mußten, das Transkript ihres in freier Rede gehaltenen Vortrags in eine lesbare Fassung zu bringen. Manche Eigentümlichkeiten des Stils sind dieser freien Rede geschuldet - oder vielleicht auch gedankt, denn sie geben damit umso lebendiger die Atmosphäre jener Frühlingstage in Weimar und Köln wieder.

BK

05.30 / Massenkommunikation / Massenmedien: Allgemeines

Classification

AP 11500 Allgemeines / Medien- und Kommunikationswissenschaften, Kommunikationsdesign / Bibliographien und Sammelschriften / Tagungs- und Kongreßberichte (CSN)
05.30 / Massenkommunikation / Massenmedien: Allgemeines

Content

Enthält u.a. die Beiträge (Dokumentarische Aspekte): Günter Perers/Volker Gaese: Das DocCat-System in der Textdokumentation von Gr+J (Weimar 2000) Thomas Gerick: Finden statt suchen. Knowledge Retrieval in Wissensbanken. Mit organisiertem Wissen zu mehr Erfolg (Weimar 2000) Winfried Gödert: Aufbereitung und Rezeption von Information (Weimar 2000) Elisabeth Damen: Klassifikation als Ordnungssystem im elektronischen Pressearchiv (Köln 2001) Clemens Schlenkrich: Aspekte neuer Regelwerksarbeit - Multimediales Datenmodell für ARD und ZDF (Köln 2001) Josef Wandeler: Comprenez-vous only Bahnhof'? - Mehrsprachigkeit in der Mediendokumentation (Köln 200 1)

Date

11. 5.2008 19:49:22

RVK

AP 11500 Allgemeines / Medien- und Kommunikationswissenschaften, Kommunikationsdesign / Bibliographien und Sammelschriften / Tagungs- und Kongreßberichte (CSN)

Lackes, R.; Tillmanns, C.: Data Mining für die Unternehmenspraxis : Entscheidungshilfen und Fallstudien mit führenden Softwarelösungen (2006) 0.02

0.021605171 = product of:
  0.10442499 = sum of:
    0.030450258 = weight(_text_:buch in 1383) [ClassicSimilarity], result of:
      0.030450258 = score(doc=1383,freq=2.0), product of:
        0.09879628 = queryWeight, product of:
          4.64937 = idf(docFreq=1149, maxDocs=44218)
          0.02124939 = queryNorm
        0.3082126 = fieldWeight in 1383, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.64937 = idf(docFreq=1149, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.022949988 = weight(_text_:und in 1383) [ClassicSimilarity], result of:
      0.022949988 = score(doc=1383,freq=22.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.48729765 = fieldWeight in 1383, product of:
          4.690416 = tf(freq=22.0), with freq of:
            22.0 = termFreq=22.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.010803019 = weight(_text_:des in 1383) [ClassicSimilarity], result of:
      0.010803019 = score(doc=1383,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.18358089 = fieldWeight in 1383, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.010803019 = weight(_text_:des in 1383) [ClassicSimilarity], result of:
      0.010803019 = score(doc=1383,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.18358089 = fieldWeight in 1383, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.020781705 = weight(_text_:nach in 1383) [ClassicSimilarity], result of:
      0.020781705 = score(doc=1383,freq=2.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.25462174 = fieldWeight in 1383, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.008636996 = product of:
      0.017273992 = sum of:
        0.017273992 = weight(_text_:22 in 1383) [ClassicSimilarity], result of:
          0.017273992 = score(doc=1383,freq=2.0), product of:
            0.07441174 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02124939 = queryNorm
            0.23214069 = fieldWeight in 1383, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.046875 = fieldNorm(doc=1383)
      0.5 = coord(1/2)
  0.20689656 = coord(6/29)

Abstract: Das Buch richtet sich an Praktiker in Unternehmen, die sich mit der Analyse von großen Datenbeständen beschäftigen. Nach einem kurzen Theorieteil werden vier Fallstudien aus dem Customer Relationship Management eines Versandhändlers bearbeitet. Dabei wurden acht führende Softwarelösungen verwendet: der Intelligent Miner von IBM, der Enterprise Miner von SAS, Clementine von SPSS, Knowledge Studio von Angoss, der Delta Miner von Bissantz, der Business Miner von Business Object und die Data Engine von MIT. Im Rahmen der Fallstudien werden die Stärken und Schwächen der einzelnen Lösungen deutlich, und die methodisch-korrekte Vorgehensweise beim Data Mining wird aufgezeigt. Beides liefert wertvolle Entscheidungshilfen für die Auswahl von Standardsoftware zum Data Mining und für die praktische Datenanalyse.
Content: Modelle, Methoden und Werkzeuge: Ziele und Aufbau der Untersuchung.- Grundlagen.- Planung und Entscheidung mit Data-Mining-Unterstützung.- Methoden.- Funktionalität und Handling der Softwarelösungen. Fallstudien: Ausgangssituation und Datenbestand im Versandhandel.- Kundensegmentierung.- Erklärung regionaler Marketingerfolge zur Neukundengewinnung.Prognose des Customer Lifetime Values.- Selektion von Kunden für eine Direktmarketingaktion.- Welche Softwarelösung für welche Entscheidung?- Fazit und Marktentwicklungen.
Date: 22. 3.2008 14:46:06

Peters, G.; Gaese, V.: ¬Das DocCat-System in der Textdokumentation von G+J (2003) 0.02

0.019648908 = product of:
  0.08140262 = sum of:
    0.01598032 = weight(_text_:und in 1507) [ClassicSimilarity], result of:
      0.01598032 = score(doc=1507,freq=24.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.33931053 = fieldWeight in 1507, product of:
          4.8989797 = tf(freq=24.0), with freq of:
            24.0 = termFreq=24.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.021213412 = weight(_text_:geschichte in 1507) [ClassicSimilarity], result of:
      0.021213412 = score(doc=1507,freq=2.0), product of:
        0.100994095 = queryWeight, product of:
          4.7528 = idf(docFreq=1036, maxDocs=44218)
          0.02124939 = queryNorm
        0.21004607 = fieldWeight in 1507, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.7528 = idf(docFreq=1036, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.007202012 = weight(_text_:des in 1507) [ClassicSimilarity], result of:
      0.007202012 = score(doc=1507,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.12238726 = fieldWeight in 1507, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.021213412 = weight(_text_:geschichte in 1507) [ClassicSimilarity], result of:
      0.021213412 = score(doc=1507,freq=2.0), product of:
        0.100994095 = queryWeight, product of:
          4.7528 = idf(docFreq=1036, maxDocs=44218)
          0.02124939 = queryNorm
        0.21004607 = fieldWeight in 1507, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.7528 = idf(docFreq=1036, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.007202012 = weight(_text_:des in 1507) [ClassicSimilarity], result of:
      0.007202012 = score(doc=1507,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.12238726 = fieldWeight in 1507, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.0028334525 = product of:
      0.005666905 = sum of:
        0.005666905 = weight(_text_:1 in 1507) [ClassicSimilarity], result of:
          0.005666905 = score(doc=1507,freq=2.0), product of:
            0.05219918 = queryWeight, product of:
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.02124939 = queryNorm
            0.1085631 = fieldWeight in 1507, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.03125 = fieldNorm(doc=1507)
      0.5 = coord(1/2)
    0.0057579977 = product of:
      0.0115159955 = sum of:
        0.0115159955 = weight(_text_:22 in 1507) [ClassicSimilarity], result of:
          0.0115159955 = score(doc=1507,freq=2.0), product of:
            0.07441174 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02124939 = queryNorm
            0.15476047 = fieldWeight in 1507, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.03125 = fieldNorm(doc=1507)
      0.5 = coord(1/2)
  0.2413793 = coord(7/29)

Abstract: Wir werden einmal die Grundlagen des Text-Mining-Systems bei IBM darstellen, dann werden wir das Projekt etwas umfangreicher und deutlicher darstellen, da kennen wir uns aus. Von daher haben wir zwei Teile, einmal Heidelberg, einmal Hamburg. Noch einmal zur Technologie. Text-Mining ist eine von IBM entwickelte Technologie, die in einer besonderen Ausformung und Programmierung für uns zusammengestellt wurde. Das Projekt hieß bei uns lange Zeit DocText Miner und heißt seit einiger Zeit auf Vorschlag von IBM DocCat, das soll eine Abkürzung für Document-Categoriser sein, sie ist ja auch nett und anschaulich. Wir fangen an mit Text-Mining, das bei IBM in Heidelberg entwickelt wurde. Die verstehen darunter das automatische Indexieren als eine Instanz, also einen Teil von Text-Mining. Probleme werden dabei gezeigt, und das Text-Mining ist eben eine Methode zur Strukturierung von und der Suche in großen Dokumentenmengen, die Extraktion von Informationen und, das ist der hohe Anspruch, von impliziten Zusammenhängen. Das letztere sei dahingestellt. IBM macht das quantitativ, empirisch, approximativ und schnell. das muss man wirklich sagen. Das Ziel, und das ist ganz wichtig für unser Projekt gewesen, ist nicht, den Text zu verstehen, sondern das Ergebnis dieser Verfahren ist, was sie auf Neudeutsch a bundle of words, a bag of words nennen, also eine Menge von bedeutungstragenden Begriffen aus einem Text zu extrahieren, aufgrund von Algorithmen, also im Wesentlichen aufgrund von Rechenoperationen. Es gibt eine ganze Menge von linguistischen Vorstudien, ein wenig Linguistik ist auch dabei, aber nicht die Grundlage der ganzen Geschichte. Was sie für uns gemacht haben, ist also die Annotierung von Pressetexten für unsere Pressedatenbank. Für diejenigen, die es noch nicht kennen: Gruner + Jahr führt eine Textdokumentation, die eine Datenbank führt, seit Anfang der 70er Jahre, da sind z.Z. etwa 6,5 Millionen Dokumente darin, davon etwas über 1 Million Volltexte ab 1993. Das Prinzip war lange Zeit, dass wir die Dokumente, die in der Datenbank gespeichert waren und sind, verschlagworten und dieses Prinzip haben wir auch dann, als der Volltext eingeführt wurde, in abgespeckter Form weitergeführt. Zu diesen 6,5 Millionen Dokumenten gehören dann eben auch ungefähr 10 Millionen Faksimileseiten, weil wir die Faksimiles auch noch standardmäßig aufheben.
Date: 22. 4.2003 11:45:36
Source: Medien-Informationsmanagement: Archivarische, dokumentarische, betriebswirtschaftliche, rechtliche und Berufsbild-Aspekte. Hrsg.: Marianne Englert u.a

Wiegmann, S.: Hättest du die Titanic überlebt? : Eine kurze Einführung in das Data Mining mit freier Software (2023) 0.02

0.017234325 = product of:
  0.09995909 = sum of:
    0.016145922 = weight(_text_:und in 876) [ClassicSimilarity], result of:
      0.016145922 = score(doc=876,freq=8.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.34282678 = fieldWeight in 876, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0546875 = fieldNorm(doc=876)
    0.012603521 = weight(_text_:des in 876) [ClassicSimilarity], result of:
      0.012603521 = score(doc=876,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.2141777 = fieldWeight in 876, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0546875 = fieldNorm(doc=876)
    0.012603521 = weight(_text_:des in 876) [ClassicSimilarity], result of:
      0.012603521 = score(doc=876,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.2141777 = fieldWeight in 876, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0546875 = fieldNorm(doc=876)
    0.024245322 = weight(_text_:nach in 876) [ClassicSimilarity], result of:
      0.024245322 = score(doc=876,freq=2.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.2970587 = fieldWeight in 876, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.0546875 = fieldNorm(doc=876)
    0.034360804 = sum of:
      0.014024875 = weight(_text_:1 in 876) [ClassicSimilarity], result of:
        0.014024875 = score(doc=876,freq=4.0), product of:
          0.05219918 = queryWeight, product of:
            2.4565027 = idf(docFreq=10304, maxDocs=44218)
            0.02124939 = queryNorm
          0.26867998 = fieldWeight in 876, product of:
            2.0 = tf(freq=4.0), with freq of:
              4.0 = termFreq=4.0
            2.4565027 = idf(docFreq=10304, maxDocs=44218)
            0.0546875 = fieldNorm(doc=876)
      0.020335928 = weight(_text_:29 in 876) [ClassicSimilarity], result of:
        0.020335928 = score(doc=876,freq=2.0), product of:
          0.07474871 = queryWeight, product of:
            3.5176873 = idf(docFreq=3565, maxDocs=44218)
            0.02124939 = queryNorm
          0.27205724 = fieldWeight in 876, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            3.5176873 = idf(docFreq=3565, maxDocs=44218)
            0.0546875 = fieldNorm(doc=876)
  0.1724138 = coord(5/29)

Abstract: Am 10. April 1912 ging Elisabeth Walton Allen an Bord der "Titanic", um ihr Hab und Gut nach England zu holen. Eines Nachts wurde sie von ihrer aufgelösten Tante geweckt, deren Kajüte unter Wasser stand. Wie steht es um Elisabeths Chancen und hätte man selbst das Unglück damals überlebt? Das Titanic-Orakel ist eine algorithmusbasierte App, die entsprechende Prognosen aufstellt und im Rahmen des Kurses "Data Science" am Department Information der HAW Hamburg entstanden ist. Dieser Beitrag zeigt Schritt für Schritt, wie die App unter Verwendung freier Software entwickelt wurde. Code und Daten werden zur Nachnutzung bereitgestellt.
Date: 28. 1.2022 11:05:29
1. 2.2023 14:03:14
Source: API Magazin. 4(2023), Nr.1 [https://journals.sub.uni-hamburg.de/hup3/apimagazin/article/view/130]

Lischka, K.: Spurensuche im Datenwust : Data-Mining-Software fahndet nach kriminellen Mitarbeitern, guten Kunden - und bald vielleicht auch nach Terroristen (2002) 0.02
```
0.015290832 = product of:
  0.088686824 = sum of:
    0.016228091 = weight(_text_:und in 1178) [ClassicSimilarity], result of:
      0.016228091 = score(doc=1178,freq=44.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.34457147 = fieldWeight in 1178, product of:
          6.6332498 = tf(freq=44.0), with freq of:
            44.0 = termFreq=44.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1178)
    0.012078141 = weight(_text_:des in 1178) [ClassicSimilarity], result of:
      0.012078141 = score(doc=1178,freq=10.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.20524967 = fieldWeight in 1178, product of:
          3.1622777 = tf(freq=10.0), with freq of:
            10.0 = termFreq=10.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1178)
    0.012078141 = weight(_text_:des in 1178) [ClassicSimilarity], result of:
      0.012078141 = score(doc=1178,freq=10.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.20524967 = fieldWeight in 1178, product of:
          3.1622777 = tf(freq=10.0), with freq of:
            10.0 = termFreq=10.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1178)
    0.023234654 = weight(_text_:nach in 1178) [ClassicSimilarity], result of:
      0.023234654 = score(doc=1178,freq=10.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.28467578 = fieldWeight in 1178, product of:
          3.1622777 = tf(freq=10.0), with freq of:
            10.0 = termFreq=10.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1178)
    0.025067797 = sum of:
      0.0164308 = weight(_text_:deutschland in 1178) [ClassicSimilarity], result of:
        0.0164308 = score(doc=1178,freq=2.0), product of:
          0.10263357 = queryWeight, product of:
            4.829954 = idf(docFreq=959, maxDocs=44218)
            0.02124939 = queryNorm
          0.16009188 = fieldWeight in 1178, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            4.829954 = idf(docFreq=959, maxDocs=44218)
            0.0234375 = fieldNorm(doc=1178)
      0.008636996 = weight(_text_:22 in 1178) [ClassicSimilarity], result of:
        0.008636996 = score(doc=1178,freq=2.0), product of:
          0.07441174 = queryWeight, product of:
            3.5018296 = idf(docFreq=3622, maxDocs=44218)
            0.02124939 = queryNorm
          0.116070345 = fieldWeight in 1178, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            3.5018296 = idf(docFreq=3622, maxDocs=44218)
            0.0234375 = fieldNorm(doc=1178)
  0.1724138 = coord(5/29)
```
Abstract

US-Behörden wollen mit spezieller Software die Datenspuren von Terroristen finden. Wie das funktionieren könnte, zeigen Programmen, die heute schon für Unternehmen Kunden und Mitarbeiter analysieren.

Content

"Ob man als Terrorist einen Anschlag gegen die Vereinigten Staaten plant, als Kassierer Scheine aus der Kasse unterschlägt oder für bestimmte Produkte besonders gerne Geld ausgibt - einen Unterschied macht Data-Mining-Software da nicht. Solche Programme analysieren riesige Daten- mengen und fällen statistische Urteile. Mit diesen Methoden wollen nun die For- scher des "Information Awaren in den Vereinigten Staaten Spuren von Terroristen in den Datenbanken von Behörden und privaten Unternehmen wie Kreditkartenfirmen finden. 200 Millionen Dollar umfasst der Jahresetat für die verschiedenen Forschungsprojekte. Dass solche Software in der Praxis funktioniert, zeigen die steigenden Umsätze der Anbieter so genannter Customer-Relationship-Management-Software. Im vergangenen Jahr ist das Potenzial für analytische CRM-Anwendungen laut dem Marktforschungsinstitut IDC weltweit um 22 Prozent gewachsen, bis zum Jahr 2006 soll es in Deutschland mit einem jährlichen Plus von 14,1 Prozent so weitergehen. Und das trotz schwacher Konjunktur - oder gerade deswegen. Denn ähnlich wie Data-Mining der USRegierung helfen soll, Terroristen zu finden, entscheiden CRM-Programme heute, welche Kunden für eine Firma profitabel sind. Und welche es künftig sein werden, wie Manuela Schnaubelt, Sprecherin des CRM-Anbieters SAP, beschreibt: "Die Kundenbewertung ist ein zentraler Bestandteil des analytischen CRM. Sie ermöglicht es Unternehmen, sich auf die für sie wichtigen und richtigen Kunden zu fokussieren. Darüber hinaus können Firmen mit speziellen Scoring- Verfahren ermitteln, welche Kunden langfristig in welchem Maße zum Unternehmenserfolg beitragen." Die Folgen der Bewertungen sind für die Betroffenen nicht immer positiv: Attraktive Kunden profitieren von individuellen Sonderangeboten und besonderer Zuwendung. Andere hängen vielleicht so lauge in der Warteschleife des Telefonservice, bis die profitableren Kunden abgearbeitet sind. So könnte eine praktische Umsetzung dessen aussehen, was SAP-Spreche-rin Schnaubelt abstrakt beschreibt: "In vielen Unternehmen wird Kundenbewertung mit der klassischen ABC-Analyse durchgeführt, bei der Kunden anhand von Daten wie dem Umsatz kategorisiert werden. A-Kunden als besonders wichtige Kunden werden anders betreut als C-Kunden." Noch näher am geplanten Einsatz von Data-Mining zur Terroristenjagd ist eine Anwendung, die heute viele Firmen erfolgreich nutzen: Sie spüren betrügende Mitarbeiter auf. Werner Sülzer vom großen CRM-Anbieter NCR Teradata beschreibt die Möglichkeiten so: "Heute hinterlässt praktisch jeder Täter - ob Mitarbeiter, Kunde oder Lieferant - Datenspuren bei seinen wirtschaftskriminellen Handlungen. Es muss vorrangig darum gehen, einzelne Spuren zu Handlungsmustern und Täterprofilen zu verdichten. Das gelingt mittels zentraler Datenlager und hoch entwickelter Such- und Analyseinstrumente." Von konkreten Erfolgen sprich: Entlas-sungen krimineller Mitarbeiter-nach Einsatz solcher Programme erzählen Unternehmen nicht gerne. Matthias Wilke von der "Beratungsstelle für Technologiefolgen und Qualifizierung" (BTQ) der Gewerkschaft Verdi weiß von einem Fall 'aus der Schweiz. Dort setzt die Handelskette "Pick Pay" das Programm "Lord Lose Prevention" ein. Zwei Monate nach Einfüh-rung seien Unterschlagungen im Wert von etwa 200 000 Franken ermittelt worden. Das kostete mehr als 50 verdächtige Kassiererinnen und Kassierer den Job.
Jede Kasse schickt die Daten zu Stornos, Rückgaben, Korrekturen und dergleichen an eine zentrale Datenbank. Aus den Informationen errechnet das Programm Kassiererprofile. Wessen Arbeit stark Durchschnitt abweicht, macht sich verdächtig. Die Kriterien" legen im Einzelnen die Revisionsabteilungen fest, doch generell gilt: "Bei Auffälligkeiten wie überdurchschnittlichvielenStornierungen, Off nen der Kassenschublade ohne Verkauf nach einem Storno oder Warenrücknahmen ohne Kassenbon, können die Vorgänge nachträglich einzelnen Personen zugeordnet werden", sagt Rene Schiller, Marketing-Chef des Lord-Herstellers Logware. Ein Kündigungsgrund ist eine solche Datensammlung vor Gericht nicht. Doch auf der Basis können Unternehmen gezielt Detektive einsetzen. Oder sie konfrontieren die Mitarbeiter mit dem Material; woraufhin Schuldige meist gestehen. Wilke sieht Programme wie Lord kritisch:"Jeder, der in dem Raster auffällt, kann ein potenzieller Betrüger oder Dieb sein und verdient besondere Beobachtung." Dabei könne man vom Standard abweichen, weil man unausgeschlafen und deshalb unkonzentriert sei. Hier tut sich für Wilke die Gefahr technisierter Leistungskontrolle auf. "Es ist ja nicht schwierig, mit den Programmen zu berechnen, wie lange beispielsweise das Kassieren eines Samstagseinkaufs durchschnittlich dauert." Die Betriebsräte - ihre Zustimmung ist beim Einsatz technischer Kon trolleinrichtungen nötig - verurteilen die wertende Software weniger eindeutig. Im Gegenteil: Bei Kaufhof und Edeka haben sie dem Einsatz zugestimmt. Denn: "Die wollen ja nicht, dass ganze Abteilungen wegen Inventurverlusten oder dergleichen unter Generalverdacht fallen", erklärt Gewerkschaftler Wilke: "Angesichts der Leistungen kommerzieller Data-Mining-Programme verblüfft es, dass in den Vereinigten Staaten das "Information Awareness Office" noch drei Jahre für Forschung und Erprobung der eigenen Programme veranschlagt. 2005 sollen frühe Prototypen zur Terroristensuche einesgetz werden. Doch schon jetzt regt sich Protest. Datenschützer wie Marc Botenberg vom Informationszentrum für Daten schutz sprechen vom "ehrgeizigsten öffentlichen Überwachungssystem, das je vorgeschlagen wurde". Sie warnen besonders davor, Daten aus der Internetnutzung und private Mails auszuwerten. Das Verteidigungsministerium rudert zurück. Man denke nicht daran, über die Software im Inland aktiv zu werden. "Das werden die Geheimdienste, die Spionageabwehr und die Strafverfolger tun", sagt Unterstaatssekretär Edward Aldridge. Man werde während der Entwicklung und der Tests mit konstruierten und einigen - aus Sicht der Datenschützer unbedenklichen - realen Informationen arbeiten. Zu denken gibt jedoch Aldriges Antwort auf die Frage, warum so viel Geld für die Entwicklung von Übersetzungssoftware eingeplant ist: Damit man Datenbanken in anderen Sprachen nutzen könne - sofern man auf sie rechtmäßigen Zugriff bekommt."

Huvila, I.: Mining qualitative data on human information behaviour from the Web (2010) 0.01

0.011556756 = product of:
  0.08378648 = sum of:
    0.011416892 = weight(_text_:und in 4676) [ClassicSimilarity], result of:
      0.011416892 = score(doc=4676,freq=4.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.24241515 = fieldWeight in 4676, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0546875 = fieldNorm(doc=4676)
    0.047162544 = weight(_text_:informationswissenschaft in 4676) [ClassicSimilarity], result of:
      0.047162544 = score(doc=4676,freq=4.0), product of:
        0.09572223 = queryWeight, product of:
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.02124939 = queryNorm
        0.4927021 = fieldWeight in 4676, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.0546875 = fieldNorm(doc=4676)
    0.012603521 = weight(_text_:des in 4676) [ClassicSimilarity], result of:
      0.012603521 = score(doc=4676,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.2141777 = fieldWeight in 4676, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0546875 = fieldNorm(doc=4676)
    0.012603521 = weight(_text_:des in 4676) [ClassicSimilarity], result of:
      0.012603521 = score(doc=4676,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.2141777 = fieldWeight in 4676, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0546875 = fieldNorm(doc=4676)
  0.13793103 = coord(4/29)

Series: Schriften zur Informationswissenschaft; Bd.58
Source: Information und Wissen: global, sozial und frei? Proceedings des 12. Internationalen Symposiums für Informationswissenschaft (ISI 2011) ; Hildesheim, 9. - 11. März 2011. Hrsg.: J. Griesbaum, T. Mandl u. C. Womser-Hacker

Keim, D.A.: Datenvisualisierung und Data Mining (2004) 0.01

0.011543283 = product of:
  0.066951044 = sum of:
    0.011532802 = weight(_text_:und in 2931) [ClassicSimilarity], result of:
      0.011532802 = score(doc=2931,freq=8.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.24487628 = fieldWeight in 2931, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
    0.023820681 = weight(_text_:informationswissenschaft in 2931) [ClassicSimilarity], result of:
      0.023820681 = score(doc=2931,freq=2.0), product of:
        0.09572223 = queryWeight, product of:
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.02124939 = queryNorm
        0.24885213 = fieldWeight in 2931, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
    0.0127314795 = weight(_text_:des in 2931) [ClassicSimilarity], result of:
      0.0127314795 = score(doc=2931,freq=4.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.21635216 = fieldWeight in 2931, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
    0.0127314795 = weight(_text_:des in 2931) [ClassicSimilarity], result of:
      0.0127314795 = score(doc=2931,freq=4.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.21635216 = fieldWeight in 2931, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
    0.006134605 = product of:
      0.01226921 = sum of:
        0.01226921 = weight(_text_:1 in 2931) [ClassicSimilarity], result of:
          0.01226921 = score(doc=2931,freq=6.0), product of:
            0.05219918 = queryWeight, product of:
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.02124939 = queryNorm
            0.23504603 = fieldWeight in 2931, product of:
              2.4494898 = tf(freq=6.0), with freq of:
                6.0 = termFreq=6.0
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.0390625 = fieldNorm(doc=2931)
      0.5 = coord(1/2)
  0.1724138 = coord(5/29)

Abstract: Die rasante technologische Entwicklung der letzten zwei Jahrzehnte ermöglicht heute die persistente Speicherung riesiger Datenmengen durch den Computer. Forscher an der Universität Berkeley haben berechnet, dass jedes Jahr ca. 1 Exabyte (= 1 Million Terabyte) Daten generiert werden - ein großer Teil davon in digitaler Form. Das bedeutet aber, dass in den nächsten drei Jahren mehr Daten generiert werden als in der gesamten menschlichen Entwicklung zuvor. Die Daten werden oft automatisch mit Hilfe von Sensoren und Überwachungssystemen aufgezeichnet. So werden beispielsweise alltägliche Vorgänge des menschlichen Lebens, wie das Bezahlen mit Kreditkarte oder die Benutzung des Telefons, durch Computer aufgezeichnet. Dabei werden gewöhnlich alle verfügbaren Parameter abgespeichert, wodurch hochdimensionale Datensätze entstehen. Die Daten werden gesammelt, da sie wertvolle Informationen enthalten, die einen Wettbewerbsvorteil bieten können. Das Finden der wertvollen Informationen in den großen Datenmengen ist aber keine leichte Aufgabe. Heutige Datenbankmanagementsysteme können nur kleine Teilmengen dieser riesigen Datenmengen darstellen. Werden die Daten zum Beispiel in textueller Form ausgegeben, können höchstens ein paar hundert Zeilen auf dem Bildschirm dargestellt werden. Bei Millionen von Datensätzen ist dies aber nur ein Tropfen auf den heißen Stein.
Source: Grundlagen der praktischen Information und Dokumentation. 5., völlig neu gefaßte Ausgabe. 2 Bde. Hrsg. von R. Kuhlen, Th. Seeger u. D. Strauch. Begründet von Klaus Laisiepen, Ernst Lutterbeck, Karl-Heinrich Meyer-Uhlenried. Bd.1: Handbuch zur Einführung in die Informationswissenschaft und -praxis

Heyer, G.; Quasthoff, U.; Wittig, T.: Text Mining : Wissensrohstoff Text. Konzepte, Algorithmen, Ergebnisse (2006) 0.01
```
0.0096894065 = product of:
  0.070248194 = sum of:
    0.020300172 = weight(_text_:buch in 5218) [ClassicSimilarity], result of:
      0.020300172 = score(doc=5218,freq=2.0), product of:
        0.09879628 = queryWeight, product of:
          4.64937 = idf(docFreq=1149, maxDocs=44218)
          0.02124939 = queryNorm
        0.20547508 = fieldWeight in 5218, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.64937 = idf(docFreq=1149, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
    0.021139976 = weight(_text_:und in 5218) [ClassicSimilarity], result of:
      0.021139976 = score(doc=5218,freq=42.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.44886562 = fieldWeight in 5218, product of:
          6.4807405 = tf(freq=42.0), with freq of:
            42.0 = termFreq=42.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
    0.014404024 = weight(_text_:des in 5218) [ClassicSimilarity], result of:
      0.014404024 = score(doc=5218,freq=8.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.24477452 = fieldWeight in 5218, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
    0.014404024 = weight(_text_:des in 5218) [ClassicSimilarity], result of:
      0.014404024 = score(doc=5218,freq=8.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.24477452 = fieldWeight in 5218, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
  0.13793103 = coord(4/29)
```
Abstract

Ein großer Teil des Weltwissens befindet sich in Form digitaler Texte im Internet oder in Intranets. Heutige Suchmaschinen nutzen diesen Wissensrohstoff nur rudimentär: Sie können semantische Zusammen-hänge nur bedingt erkennen. Alle warten auf das semantische Web, in dem die Ersteller von Text selbst die Semantik einfügen. Das wird aber noch lange dauern. Es gibt jedoch eine Technologie, die es bereits heute ermöglicht semantische Zusammenhänge in Rohtexten zu analysieren und aufzubereiten. Das Forschungsgebiet "Text Mining" ermöglicht es mit Hilfe statistischer und musterbasierter Verfahren, Wissen aus Texten zu extrahieren, zu verarbeiten und zu nutzen. Hier wird die Basis für die Suchmaschinen der Zukunft gelegt. Das erste deutsche Lehrbuch zu einer bahnbrechenden Technologie: Text Mining: Wissensrohstoff Text Konzepte, Algorithmen, Ergebnisse Ein großer Teil des Weltwissens befindet sich in Form digitaler Texte im Internet oder in Intranets. Heutige Suchmaschinen nutzen diesen Wissensrohstoff nur rudimentär: Sie können semantische Zusammen-hänge nur bedingt erkennen. Alle warten auf das semantische Web, in dem die Ersteller von Text selbst die Semantik einfügen. Das wird aber noch lange dauern. Es gibt jedoch eine Technologie, die es bereits heute ermöglicht semantische Zusammenhänge in Rohtexten zu analysieren und aufzubereiten. Das For-schungsgebiet "Text Mining" ermöglicht es mit Hilfe statistischer und musterbasierter Verfahren, Wissen aus Texten zu extrahieren, zu verarbeiten und zu nutzen. Hier wird die Basis für die Suchmaschinen der Zukunft gelegt. Was fällt Ihnen bei dem Wort "Stich" ein? Die einen denken an Tennis, die anderen an Skat. Die verschiedenen Zusammenhänge können durch Text Mining automatisch ermittelt und in Form von Wortnetzen dargestellt werden. Welche Begriffe stehen am häufigsten links und rechts vom Wort "Festplatte"? Welche Wortformen und Eigennamen treten seit 2001 neu in der deutschen Sprache auf? Text Mining beantwortet diese und viele weitere Fragen. Tauchen Sie mit diesem Lehrbuch ein in eine neue, faszinierende Wissenschaftsdisziplin und entdecken Sie neue, bisher unbekannte Zusammenhänge und Sichtweisen. Sehen Sie, wie aus dem Wissensrohstoff Text Wissen wird! Dieses Lehrbuch richtet sich sowohl an Studierende als auch an Praktiker mit einem fachlichen Schwerpunkt in der Informatik, Wirtschaftsinformatik und/oder Linguistik, die sich über die Grundlagen, Verfahren und Anwendungen des Text Mining informieren möchten und Anregungen für die Implementierung eigener Anwendungen suchen. Es basiert auf Arbeiten, die während der letzten Jahre an der Abteilung Automatische Sprachverarbeitung am Institut für Informatik der Universität Leipzig unter Leitung von Prof. Dr. Heyer entstanden sind. Eine Fülle praktischer Beispiele von Text Mining-Konzepten und -Algorithmen verhelfen dem Leser zu einem umfassenden, aber auch detaillierten Verständnis der Grundlagen und Anwendungen des Text Mining. Folgende Themen werden behandelt: Wissen und Text Grundlagen der Bedeutungsanalyse Textdatenbanken Sprachstatistik Clustering Musteranalyse Hybride Verfahren Beispielanwendungen Anhänge: Statistik und linguistische Grundlagen 360 Seiten, 54 Abb., 58 Tabellen und 95 Glossarbegriffe Mit kostenlosen e-learning-Kurs "Schnelleinstieg: Sprachstatistik" Zusätzlich zum Buch gibt es in Kürze einen Online-Zertifikats-Kurs mit Mentor- und Tutorunterstützung.

Witschel, H.F.: Text, Wörter, Morpheme : Möglichkeiten einer automatischen Terminologie-Extraktion (2004) 0.01

0.009270331 = product of:
  0.0672099 = sum of:
    0.011532802 = weight(_text_:und in 126) [ClassicSimilarity], result of:
      0.011532802 = score(doc=126,freq=8.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.24487628 = fieldWeight in 126, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
    0.015592814 = weight(_text_:des in 126) [ClassicSimilarity], result of:
      0.015592814 = score(doc=126,freq=6.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.2649762 = fieldWeight in 126, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
    0.015592814 = weight(_text_:des in 126) [ClassicSimilarity], result of:
      0.015592814 = score(doc=126,freq=6.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.2649762 = fieldWeight in 126, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
    0.024491474 = weight(_text_:nach in 126) [ClassicSimilarity], result of:
      0.024491474 = score(doc=126,freq=4.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.3000746 = fieldWeight in 126, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
  0.13793103 = coord(4/29)

Abstract: Die vorliegende Arbeit beschäftigt sich mit einem Teilgebiet des TextMining, versucht also Information (in diesem Fall Fachterminologie) aus natürlichsprachlichem Text zu extrahieren. Die der Arbeit zugrundeliegende These besagt, daß in vielen Gebieten des Text Mining die Kombination verschiedener Methoden sinnvoll sein kann, um dem Facettenreichtum natürlicher Sprache gerecht zu werden. Die bei der Terminologie-Extraktion angewandten Methoden sind statistischer und linguistischer (bzw. musterbasierter) Natur. Um sie herzuleiten, wurden einige Eigenschaften von Fachtermini herausgearbeitet, die für deren Extraktion relevant sind. So läßt sich z.B. die Tatsache, daß viele Fachbegriffe Nominalphrasen einer bestimmten Form sind, direkt für eine Suche nach gewissen POS-Mustern ausnützen, die Verteilung von Termen in Fachtexten führte zu einem statistischen Ansatz - der Differenzanalyse. Zusammen mit einigen weiteren wurden diese Ansätze in ein Verfahren integriert, welches in der Lage ist, aus dem Feedback eines Anwenders zu lernen und in mehreren Schritten die Suche nach Terminologie zu verfeinern. Dabei wurden mehrere Parameter des Verfahrens veränderlich belassen, d.h. der Anwender kann sie beliebig anpassen. Bei der Untersuchung der Ergebnisse anhand von zwei Fachtexten aus unterschiedlichen Domänen wurde deutlich, daß sich zwar die verschiedenen Verfahren gut ergänzen, daß aber die optimalen Werte der veränderbaren Parameter, ja selbst die Auswahl der angewendeten Verfahren text- und domänenabhängig sind.
Imprint: Leipzig : Universität / Fakultät für Mathematik und Informatik Institut für Informatik

Heyer, G.; Läuter, M.; Quasthoff, U.; Wolff, C.: Texttechnologische Anwendungen am Beispiel Text Mining (2000) 0.01

0.008942782 = product of:
  0.06483517 = sum of:
    0.013839362 = weight(_text_:und in 5565) [ClassicSimilarity], result of:
      0.013839362 = score(doc=5565,freq=8.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.29385152 = fieldWeight in 5565, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.046875 = fieldNorm(doc=5565)
    0.010803019 = weight(_text_:des in 5565) [ClassicSimilarity], result of:
      0.010803019 = score(doc=5565,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.18358089 = fieldWeight in 5565, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.046875 = fieldNorm(doc=5565)
    0.010803019 = weight(_text_:des in 5565) [ClassicSimilarity], result of:
      0.010803019 = score(doc=5565,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.18358089 = fieldWeight in 5565, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.046875 = fieldNorm(doc=5565)
    0.02938977 = weight(_text_:nach in 5565) [ClassicSimilarity], result of:
      0.02938977 = score(doc=5565,freq=4.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.36008954 = fieldWeight in 5565, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.046875 = fieldNorm(doc=5565)
  0.13793103 = coord(4/29)

Abstract: Die zunehmende Menge von Informationen und deren weltweite Verfügbarkeit auf der Basis moderner Internet Technologie machen es erforderlich, Informationen nach inhaltlichen Kriterien zu strukturieren und zu bewerten sowie nach inhaltlichen Kriterien weiter zu verarbeiten. Vom Standpunkt des Benutzers aus sind dabei folgende Fälle zu unterscheiden: Handelt es sich bei den gesuchten Informationen um strukturierle Daten (z.B. in einer SQL-Datenbank) oder unstrukturierte Daten (z.B. grosse Texte)? Ist bekannt, welche Daten benötigt werden und wie sie zu finden sind? Oder ist vor dein Zugriff auf die Daten noch nicht bekannt welche Ergebnisse erwartet werden?
Source: Sprachtechnologie für eine dynamische Wirtschaft im Medienzeitalter - Language technologies for dynamic business in the age of the media - L'ingénierie linguistique au service de la dynamisation économique à l'ère du multimédia: Tagungsakten der XXVI. Jahrestagung der Internationalen Vereinigung Sprache und Wirtschaft e.V., 23.-25.11.2000, Fachhochschule Köln. Hrsg.: K.-D. Schmitz

Mandl, T.: Text Mining und Data Mining (2023) 0.01

0.008003681 = product of:
  0.077368915 = sum of:
    0.019774636 = weight(_text_:und in 774) [ClassicSimilarity], result of:
      0.019774636 = score(doc=774,freq=12.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.41987535 = fieldWeight in 774, product of:
          3.4641016 = tf(freq=12.0), with freq of:
            12.0 = termFreq=12.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0546875 = fieldNorm(doc=774)
    0.033348955 = weight(_text_:informationswissenschaft in 774) [ClassicSimilarity], result of:
      0.033348955 = score(doc=774,freq=2.0), product of:
        0.09572223 = queryWeight, product of:
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.02124939 = queryNorm
        0.348393 = fieldWeight in 774, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.0546875 = fieldNorm(doc=774)
    0.024245322 = weight(_text_:nach in 774) [ClassicSimilarity], result of:
      0.024245322 = score(doc=774,freq=2.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.2970587 = fieldWeight in 774, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.0546875 = fieldNorm(doc=774)
  0.10344828 = coord(3/29)

Abstract: Text und Data Mining sind ein Bündel von Technologien, die eng mit den Themenfeldern Statistik, Maschinelles Lernen und dem Erkennen von Mustern verbunden sind. Die üblichen Definitionen beziehen eine Vielzahl von verschiedenen Verfahren mit ein, ohne eine exakte Grenze zu ziehen. Data Mining bezeichnet die Suche nach Mustern, Regelmäßigkeiten oder Auffälligkeiten in stark strukturierten und vor allem numerischen Daten. "Any algorithm that enumerates patterns from, or fits models to, data is a data mining algorithm." Numerische Daten und Datenbankinhalte werden als strukturierte Daten bezeichnet. Dagegen gelten Textdokumente in natürlicher Sprache als unstrukturierte Daten.
Source: Grundlagen der Informationswissenschaft. Hrsg.: Rainer Kuhlen, Dirk Lewandowski, Wolfgang Semar und Christa Womser-Hacker. 7., völlig neu gefasste Ausg

Data mining : Theoretische Aspekte und Anwendungen (1998) 0.01

0.007070638 = product of:
  0.068349496 = sum of:
    0.018452484 = weight(_text_:und in 966) [ClassicSimilarity], result of:
      0.018452484 = score(doc=966,freq=8.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.39180204 = fieldWeight in 966, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=966)
    0.024948504 = weight(_text_:des in 966) [ClassicSimilarity], result of:
      0.024948504 = score(doc=966,freq=6.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.42396194 = fieldWeight in 966, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0625 = fieldNorm(doc=966)
    0.024948504 = weight(_text_:des in 966) [ClassicSimilarity], result of:
      0.024948504 = score(doc=966,freq=6.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.42396194 = fieldWeight in 966, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0625 = fieldNorm(doc=966)
  0.10344828 = coord(3/29)

Abstract: Behandelt werden u.a. die Themen: Ziele und Methoden des Data Mining, Prozeß der Wissensentdeckung, State of the Art in der Forschung und Anwendung des Data Mining, wichtige Data Mining Tools, die Rolle der Informationsverarbeitung im KDD Prozeß, Data Warehousing, OLAP, Ansätze zur Benutzerunterstüzung des Data Mining Prozesses, Modellselektion und Evaluierungsmethoden für Data Mining Algorithmen

Tiefschürfen in Datenbanken (2002) 0.01

0.0068489406 = product of:
  0.04965482 = sum of:
    0.009226242 = weight(_text_:und in 996) [ClassicSimilarity], result of:
      0.009226242 = score(doc=996,freq=2.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.19590102 = fieldWeight in 996, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=996)
    0.014404024 = weight(_text_:des in 996) [ClassicSimilarity], result of:
      0.014404024 = score(doc=996,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.24477452 = fieldWeight in 996, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0625 = fieldNorm(doc=996)
    0.014404024 = weight(_text_:des in 996) [ClassicSimilarity], result of:
      0.014404024 = score(doc=996,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.24477452 = fieldWeight in 996, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0625 = fieldNorm(doc=996)
    0.01162053 = product of:
      0.02324106 = sum of:
        0.02324106 = weight(_text_:29 in 996) [ClassicSimilarity], result of:
          0.02324106 = score(doc=996,freq=2.0), product of:
            0.07474871 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02124939 = queryNorm
            0.31092256 = fieldWeight in 996, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.0625 = fieldNorm(doc=996)
      0.5 = coord(1/2)
  0.13793103 = coord(4/29)

Abstract: Ein Einkauf im Supermarkt, ein Telefongespräch, ein Klick im Internet: Die Spuren solcher Allerweltsaktionen häufen sich zu Datengebirgen ungeheuren Ausmaßes. Darin noch das Wesentlich - was immer das sein mag - zu finden, ist die Aufgabe des noch jungen Wissenschaftszweiges Data Mining, der mit offiziellem Namen "Wissensentdeckung in Datenbanken" heißt
Content: Enthält die Beiträge: Kruse, R., C. Borgelt: Suche im Datendschungel - Borgelt, C. u. R. Kruse: Unsicheres Wissen nutzen - Wrobel, S.: Lern- und Entdeckungsverfahren - Keim, D.A.: Data Mining mit bloßem Auge
Date: 31.12.1996 19:29:41

Keim, D.A.: Data Mining mit bloßem Auge (2002) 0.01

0.0062734005 = product of:
  0.06064287 = sum of:
    0.021606037 = weight(_text_:des in 1086) [ClassicSimilarity], result of:
      0.021606037 = score(doc=1086,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.36716178 = fieldWeight in 1086, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.09375 = fieldNorm(doc=1086)
    0.021606037 = weight(_text_:des in 1086) [ClassicSimilarity], result of:
      0.021606037 = score(doc=1086,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.36716178 = fieldWeight in 1086, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.09375 = fieldNorm(doc=1086)
    0.017430795 = product of:
      0.03486159 = sum of:
        0.03486159 = weight(_text_:29 in 1086) [ClassicSimilarity], result of:
          0.03486159 = score(doc=1086,freq=2.0), product of:
            0.07474871 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02124939 = queryNorm
            0.46638384 = fieldWeight in 1086, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.09375 = fieldNorm(doc=1086)
      0.5 = coord(1/2)
  0.10344828 = coord(3/29)

Abstract: Visualisierungen, die möglichst instruktive grafische Darstellung von Daten, ist wesentlicher Bestandteil des Data Mining
Date: 31.12.1996 19:29:41

Seidenfaden, U.: Schürfen in Datenbergen : Data-Mining soll möglichst viel Information zu Tage fördern (2001) 0.01
```
0.006209308 = product of:
  0.04501748 = sum of:
    0.011416892 = weight(_text_:und in 6923) [ClassicSimilarity], result of:
      0.011416892 = score(doc=6923,freq=16.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.24241515 = fieldWeight in 6923, product of:
          4.0 = tf(freq=16.0), with freq of:
            16.0 = termFreq=16.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02734375 = fieldNorm(doc=6923)
    0.0063017607 = weight(_text_:des in 6923) [ClassicSimilarity], result of:
      0.0063017607 = score(doc=6923,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.10708885 = fieldWeight in 6923, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02734375 = fieldNorm(doc=6923)
    0.0063017607 = weight(_text_:des in 6923) [ClassicSimilarity], result of:
      0.0063017607 = score(doc=6923,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.10708885 = fieldWeight in 6923, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02734375 = fieldNorm(doc=6923)
    0.020997068 = weight(_text_:nach in 6923) [ClassicSimilarity], result of:
      0.020997068 = score(doc=6923,freq=6.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.2572604 = fieldWeight in 6923, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02734375 = fieldNorm(doc=6923)
  0.13793103 = coord(4/29)
```
Content

"Fast alles wird heute per Computer erfasst. Kaum einer überblickt noch die enormen Datenmengen, die sich in Unternehmen, Universitäten und Verwaltung ansammeln. Allein in den öffentlich zugänglichen Datenbanken der Genforscher fallen pro Woche rund 4,5 Gigabyte an neuer Information an. "Vom potentiellen Wissen in den Datenbanken wird bislang aber oft nur ein Teil genutzt", meint Stefan Wrobel vom Lehrstuhl für Wissensentdeckung und Maschinelles Lernen der Otto-von-Guericke-Universität in Magdeburg. Sein Doktorand Mark-Andre Krogel hat soeben mit einem neuen Verfahren zur Datenbankrecherche in San Francisco einen inoffiziellen Weltmeister-Titel in der Disziplin "Data-Mining" gewonnen. Dieser Daten-Bergbau arbeitet im Unterschied zur einfachen Datenbankabfrage, die sich einfacher statistischer Methoden bedient, zusätzlich mit künstlicher Intelligenz und Visualisierungsverfahren, um Querverbindungen zu finden. "Das erleichtert die Suche nach verborgenen Zusammenhängen im Datenmaterial ganz erheblich", so Wrobel. Die Wirtschaft setzt Data-Mining bereits ein, um das Kundenverhalten zu untersuchen und vorherzusagen. "Stellen sie sich ein Unternehmen mit einer breiten Produktpalette und einem großen Kundenstamm vor", erklärt Wrobel. "Es kann seinen Erfolg maximieren, wenn es Marketing-Post zielgerichtet an seine Kunden verschickt. Wer etwa gerade einen PC gekauft hat, ist womöglich auch an einem Drucker oder Scanner interessiert." In einigen Jahren könnte ein Analysemodul den Manager eines Unternehmens selbständig informieren, wenn ihm etwas Ungewöhnliches aufgefallen ist. Das muss nicht immer positiv für den Kunden sein. Data-Mining ließe sich auch verwenden, um die Lebensdauer von Geschäftsbeziehungen zu prognostizieren. Für Kunden mit geringen Kaufinteressen würden Reklamationen dann längere Bearbeitungszeiten nach sich ziehen. Im konkreten Projekt von Mark-Andre Krogel ging es um die Vorhersage von Protein-Funktionen. Proteine sind Eiweißmoleküle, die fast alle Stoffwechselvorgänge im menschlichen Körper steuern. Sie sind daher die primären Ziele von Wirkstoffen zur Behandlung von Erkrankungen. Das erklärt das große Interesse der Pharmaindustrie. Experimentelle Untersuchungen, die Aufschluss über die Aufgaben der über 100 000 Eiweißmoleküle im menschlichen Körper geben können, sind mit einem hohen Zeitaufwand verbunden. Die Forscher möchten deshalb die Zeit verkürzen, indem sie das vorhandene Datenmaterial mit Hilfe von Data-Mining auswerten. Aus der im Humangenomprojekt bereits entschlüsselten Abfolge der Erbgut-Bausteine lässt sich per Datenbankanalyse die Aneinanderreihung bestimmter Aminosäuren zu einem Protein vorhersagen. Andere Datenbanken wiederum enthalten Informationen, welche Struktur ein Protein mit einer bestimmten vorgegebenen Funktion haben könnte. Aus bereits bekannten Strukturelementen versuchen die Genforscher dann, auf die mögliche Funktion eines bislang noch unbekannten Eiweißmoleküls zu schließen.- Fakten Verschmelzen - Bei diesem theoretischen Ansatz kommt es darauf an, die in Datenbanken enthaltenen Informationen so zu verknüpfen, dass die Ergebnisse mit hoher Wahrscheinlichkeit mit der Realität übereinstimmen. "Im Rahmen des Wettbewerbs erhielten wir Tabellen als Vorgabe, in denen Gene und Chromosomen nach bestimmten Gesichtspunkten klassifiziert waren", erläutert Krogel. Von einigen Genen war bekannt, welche Proteine sie produzieren und welche Aufgabe diese Eiweißmoleküle besitzen. Diese Beispiele dienten dem von Krogel entwickelten Programm dann als Hilfe, für andere Gene vorherzusagen, welche Funktionen die von ihnen erzeugten Proteine haben. "Die Genauigkeit der Vorhersage lag bei den gestellten Aufgaben bei über 90 Prozent", stellt Krogel fest. Allerdings könne man in der Praxis nicht davon ausgehen, dass alle Informationen aus verschiedenen Datenbanken in einem einheitlichen Format vorliegen. Es gebe verschiedene Abfragesprachen der Datenbanken, und die Bezeichnungen von Eiweißmolekülen mit gleicher Aufgabe seien oftmals uneinheitlich. Die Magdeburger Informatiker arbeiten deshalb in der DFG-Forschergruppe "Informationsfusion" an Methoden, um die verschiedenen Datenquellen besser zu erschließen."

Loonus, Y.: Einsatzbereiche der KI und ihre Relevanz für Information Professionals (2017) 0.01

0.0059042624 = product of:
  0.042805903 = sum of:
    0.016949687 = weight(_text_:und in 5668) [ClassicSimilarity], result of:
      0.016949687 = score(doc=5668,freq=12.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.35989314 = fieldWeight in 5668, product of:
          3.4641016 = tf(freq=12.0), with freq of:
            12.0 = termFreq=12.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.046875 = fieldNorm(doc=5668)
    0.010803019 = weight(_text_:des in 5668) [ClassicSimilarity], result of:
      0.010803019 = score(doc=5668,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.18358089 = fieldWeight in 5668, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.046875 = fieldNorm(doc=5668)
    0.010803019 = weight(_text_:des in 5668) [ClassicSimilarity], result of:
      0.010803019 = score(doc=5668,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.18358089 = fieldWeight in 5668, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.046875 = fieldNorm(doc=5668)
    0.004250179 = product of:
      0.008500358 = sum of:
        0.008500358 = weight(_text_:1 in 5668) [ClassicSimilarity], result of:
          0.008500358 = score(doc=5668,freq=2.0), product of:
            0.05219918 = queryWeight, product of:
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.02124939 = queryNorm
            0.16284466 = fieldWeight in 5668, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.046875 = fieldNorm(doc=5668)
      0.5 = coord(1/2)
  0.13793103 = coord(4/29)

Abstract: Es liegt in der Natur des Menschen, Erfahrungen und Ideen in Wort und Schrift mit anderen teilen zu wollen. So produzieren wir jeden Tag gigantische Mengen an Texten, die in digitaler Form geteilt und abgelegt werden. The Radicati Group schätzt, dass 2017 täglich 269 Milliarden E-Mails versendet und empfangen werden. Hinzu kommen größtenteils unstrukturierte Daten wie Soziale Medien, Presse, Websites und firmeninterne Systeme, beispielsweise in Form von CRM-Software oder PDF-Dokumenten. Der weltweite Bestand an unstrukturierten Daten wächst so rasant, dass es kaum möglich ist, seinen Umfang zu quantifizieren. Der Versuch, eine belastbare Zahl zu recherchieren, führt unweigerlich zu diversen Artikeln, die den Anteil unstrukturierter Texte am gesamten Datenbestand auf 80% schätzen. Auch wenn nicht mehr einwandfrei nachvollziehbar ist, woher diese Zahl stammt, kann bei kritischer Reflexion unseres Tagesablaufs kaum bezweifelt werden, dass diese Daten von großer wirtschaftlicher Relevanz sind.
Source: Open Password. 2017, Nr.265 vom 11.10.2017. [http://www.password-online.de/?wysija-page=1&controller=email&action=view&email_id=340&wysijap=subscriptions&user_id=1045]

Schwartz, D.: Graphische Datenanalyse für digitale Bibliotheken : Leistungs- und Funktionsumfang moderner Analyse- und Visualisierungsinstrumente (2006) 0.01

0.005830261 = product of:
  0.056359187 = sum of:
    0.018051691 = weight(_text_:und in 30) [ClassicSimilarity], result of:
      0.018051691 = score(doc=30,freq=10.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.38329202 = fieldWeight in 30, product of:
          3.1622777 = tf(freq=10.0), with freq of:
            10.0 = termFreq=10.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0546875 = fieldNorm(doc=30)
    0.033348955 = weight(_text_:informationswissenschaft in 30) [ClassicSimilarity], result of:
      0.033348955 = score(doc=30,freq=2.0), product of:
        0.09572223 = queryWeight, product of:
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.02124939 = queryNorm
        0.348393 = fieldWeight in 30, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          4.504705 = idf(docFreq=1328, maxDocs=44218)
          0.0546875 = fieldNorm(doc=30)
    0.0049585416 = product of:
      0.009917083 = sum of:
        0.009917083 = weight(_text_:1 in 30) [ClassicSimilarity], result of:
          0.009917083 = score(doc=30,freq=2.0), product of:
            0.05219918 = queryWeight, product of:
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.02124939 = queryNorm
            0.18998542 = fieldWeight in 30, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.0546875 = fieldNorm(doc=30)
      0.5 = coord(1/2)
  0.10344828 = coord(3/29)

Abstract: Das World Wide Web stellt umfangreiche Datenmengen zur Verfügung. Für den Benutzer wird es zunehmend schwieriger, diese Datenmengen zu sichten, zu bewerten und die relevanten Daten herauszufiltern. Einen Lösungsansatz für diese Problemstellung bieten Visualisierungsinstrumente, mit deren Hilfe Rechercheergebnisse nicht mehr ausschließlich über textbasierte Dokumentenlisten, sondern über Symbole, Icons oder graphische Elemente dargestellt werden. Durch geeignete Visualisierungstechniken können Informationsstrukturen in großen Datenmengen aufgezeigt werden. Informationsvisualisierung ist damit ein Instrument, um Rechercheergebnisse in einer digitalen Bibliothek zu strukturieren und relevante Daten für den Benutzer leichter auffindbar zu machen.
Series: Beiträge zur Bibliotheks- und Informationswissenschaft; 1

Kipcic, O.; Cramer, C.: Wie Zeitungsinhalte Forschung und Entwicklung befördern (2017) 0.01

0.0057302616 = product of:
  0.055392526 = sum of:
    0.016145922 = weight(_text_:und in 3885) [ClassicSimilarity], result of:
      0.016145922 = score(doc=3885,freq=8.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.34282678 = fieldWeight in 3885, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0546875 = fieldNorm(doc=3885)
    0.034288064 = weight(_text_:nach in 3885) [ClassicSimilarity], result of:
      0.034288064 = score(doc=3885,freq=4.0), product of:
        0.08161795 = queryWeight, product of:
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.02124939 = queryNorm
        0.42010444 = fieldWeight in 3885, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          3.840955 = idf(docFreq=2580, maxDocs=44218)
          0.0546875 = fieldNorm(doc=3885)
    0.0049585416 = product of:
      0.009917083 = sum of:
        0.009917083 = weight(_text_:1 in 3885) [ClassicSimilarity], result of:
          0.009917083 = score(doc=3885,freq=2.0), product of:
            0.05219918 = queryWeight, product of:
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.02124939 = queryNorm
            0.18998542 = fieldWeight in 3885, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.4565027 = idf(docFreq=10304, maxDocs=44218)
              0.0546875 = fieldNorm(doc=3885)
      0.5 = coord(1/2)
  0.10344828 = coord(3/29)

Abstract: Das F.A.Z.-Archiv ist nach innen das Informationszentrum der F.A.Z. Hier ist seine oberste Aufgabe die Informationsversorgung der Redaktionen der F.A.Z. GmbH und der Nachweis der F.A.Z. mit allen Teilen und Ausgaben. Nach außen tritt es als Vermarkter von Zeitungsdaten auf, dies sowohl für das eigene Haus wie auch für Dritte. Klarer Auftrag ist dabei die Generierung von Erlösen für die F.A.Z.-Gruppe durch Informations- und Datenbankdienste für externe Kunden.
Source: Open Password. 2017, Nr.237 vom 20.07.2017 [http://www.password-online.de/?wysija-page=1&controller=email&action=view&email_id=294&wysijap=subscriptions&user_id=623]

Ester, M.; Sander, J.: Knowledge discovery in databases : Techniken und Anwendungen (2000) 0.01

0.005505351 = product of:
  0.05321839 = sum of:
    0.024410341 = weight(_text_:und in 1374) [ClassicSimilarity], result of:
      0.024410341 = score(doc=1374,freq=14.0), product of:
        0.047096446 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02124939 = queryNorm
        0.51830536 = fieldWeight in 1374, product of:
          3.7416575 = tf(freq=14.0), with freq of:
            14.0 = termFreq=14.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=1374)
    0.014404024 = weight(_text_:des in 1374) [ClassicSimilarity], result of:
      0.014404024 = score(doc=1374,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.24477452 = fieldWeight in 1374, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0625 = fieldNorm(doc=1374)
    0.014404024 = weight(_text_:des in 1374) [ClassicSimilarity], result of:
      0.014404024 = score(doc=1374,freq=2.0), product of:
        0.058846094 = queryWeight, product of:
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.02124939 = queryNorm
        0.24477452 = fieldWeight in 1374, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.7693076 = idf(docFreq=7536, maxDocs=44218)
          0.0625 = fieldNorm(doc=1374)
  0.10344828 = coord(3/29)

Abstract: Knowledge Discovery in Databases (KDD) ist ein aktuelles Forschungs- und Anwendungsgebiet der Informatik. Ziel des KDD ist es, selbständig entscheidungsrelevante, aber bisher unbekannte Zusammenhänge und Verknüpfungen in den Daten großer Datenmengen zu entdecken und dem Analysten oder dem Anwender in übersichtlicher Form zu präsentieren. Die Autoren stellen die Techniken und Anwendungen dieses interdisziplinären Gebiets anschaulich dar.
Content: Einleitung.- Statistik- und Datenbank-Grundlagen.Klassifikation.- Assoziationsregeln.- Generalisierung und Data Cubes.- Spatial-, Text-, Web-, Temporal-Data Mining. Ausblick.

Budzik, J.; Hammond, K.J.; Birnbaum, L.: Information access in context (2001) 0.01

0.005366511 = product of:
  0.077814415 = sum of:
    0.017308388 = product of:
      0.051925164 = sum of:
        0.051925164 = weight(_text_:l in 3835) [ClassicSimilarity], result of:
          0.051925164 = score(doc=3835,freq=2.0), product of:
            0.08445894 = queryWeight, product of:
              3.9746525 = idf(docFreq=2257, maxDocs=44218)
              0.02124939 = queryNorm
            0.6147977 = fieldWeight in 3835, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.9746525 = idf(docFreq=2257, maxDocs=44218)
              0.109375 = fieldNorm(doc=3835)
      0.33333334 = coord(1/3)
    0.060506023 = sum of:
      0.019834166 = weight(_text_:1 in 3835) [ClassicSimilarity], result of:
        0.019834166 = score(doc=3835,freq=2.0), product of:
          0.05219918 = queryWeight, product of:
            2.4565027 = idf(docFreq=10304, maxDocs=44218)
            0.02124939 = queryNorm
          0.37997085 = fieldWeight in 3835, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            2.4565027 = idf(docFreq=10304, maxDocs=44218)
            0.109375 = fieldNorm(doc=3835)
      0.040671855 = weight(_text_:29 in 3835) [ClassicSimilarity], result of:
        0.040671855 = score(doc=3835,freq=2.0), product of:
          0.07474871 = queryWeight, product of:
            3.5176873 = idf(docFreq=3565, maxDocs=44218)
            0.02124939 = queryNorm
          0.5441145 = fieldWeight in 3835, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            3.5176873 = idf(docFreq=3565, maxDocs=44218)
            0.109375 = fieldNorm(doc=3835)
  0.06896552 = coord(2/29)

Date: 29. 3.2002 17:31:17
Source: Knowledge-based systems. 14(2001) nos.1/2, S.37-53

Search (90 results, page 1 of 5)

Authors

Years

Languages

Types

Themes

Subjects

Classifications