Search (168 results, page 1 of 9)

Methodologies for knowledge discovery and data mining : Third Pacific-Asia Conference, PAKDD'99, Beijing, China, April 26-28, 1999, Proceedings (1999) 0.04

0.04166319 = product of:
  0.15276502 = sum of:
    0.009840704 = product of:
      0.019681407 = sum of:
        0.019681407 = weight(_text_:29 in 3821) [ClassicSimilarity], result of:
          0.019681407 = score(doc=3821,freq=2.0), product of:
            0.072342895 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02056547 = queryNorm
            0.27205724 = fieldWeight in 3821, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.0546875 = fieldNorm(doc=3821)
      0.5 = coord(1/2)
    0.066604465 = weight(_text_:lecture in 3821) [ClassicSimilarity], result of:
      0.066604465 = score(doc=3821,freq=2.0), product of:
        0.13308205 = queryWeight, product of:
          6.4711404 = idf(docFreq=185, maxDocs=44218)
          0.02056547 = queryNorm
        0.5004767 = fieldWeight in 3821, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          6.4711404 = idf(docFreq=185, maxDocs=44218)
          0.0546875 = fieldNorm(doc=3821)
    0.045397673 = weight(_text_:notes in 3821) [ClassicSimilarity], result of:
      0.045397673 = score(doc=3821,freq=2.0), product of:
        0.10987139 = queryWeight, product of:
          5.3425174 = idf(docFreq=574, maxDocs=44218)
          0.02056547 = queryNorm
        0.41318923 = fieldWeight in 3821, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          5.3425174 = idf(docFreq=574, maxDocs=44218)
          0.0546875 = fieldNorm(doc=3821)
    0.004161952 = weight(_text_:in in 3821) [ClassicSimilarity], result of:
      0.004161952 = score(doc=3821,freq=4.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.14877784 = fieldWeight in 3821, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0546875 = fieldNorm(doc=3821)
    0.021242218 = weight(_text_:computer in 3821) [ClassicSimilarity], result of:
      0.021242218 = score(doc=3821,freq=2.0), product of:
        0.0751567 = queryWeight, product of:
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.02056547 = queryNorm
        0.28263903 = fieldWeight in 3821, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.0546875 = fieldNorm(doc=3821)
    0.0055180113 = product of:
      0.011036023 = sum of:
        0.011036023 = weight(_text_:science in 3821) [ClassicSimilarity], result of:
          0.011036023 = score(doc=3821,freq=2.0), product of:
            0.0541719 = queryWeight, product of:
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.02056547 = queryNorm
            0.20372227 = fieldWeight in 3821, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.0546875 = fieldNorm(doc=3821)
      0.5 = coord(1/2)
  0.27272728 = coord(6/22)

Abstract: The 29 revised full papers presented together with 37 short papers were carefully selected from a total of 158 submissions. The book is divided into sections on emerging KDD technology; association rules; feature selection and generation; mining in semi-unstructured data; interestingness, surprisingness, and exceptions; rough sets, fuzzy logic, and neural networks; induction, classification, and clustering; visualization, causal models and graph-based methods; agent-based and distributed data mining; and advanced topics and new methodologies
Series: Lecture notes in computer science; vol.1574

Principles of data mining and knowledge discovery (1998) 0.04

0.0371232 = product of:
  0.16334207 = sum of:
    0.076119386 = weight(_text_:lecture in 3822) [ClassicSimilarity], result of:
      0.076119386 = score(doc=3822,freq=2.0), product of:
        0.13308205 = queryWeight, product of:
          6.4711404 = idf(docFreq=185, maxDocs=44218)
          0.02056547 = queryNorm
        0.5719734 = fieldWeight in 3822, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          6.4711404 = idf(docFreq=185, maxDocs=44218)
          0.0625 = fieldNorm(doc=3822)
    0.051883057 = weight(_text_:notes in 3822) [ClassicSimilarity], result of:
      0.051883057 = score(doc=3822,freq=2.0), product of:
        0.10987139 = queryWeight, product of:
          5.3425174 = idf(docFreq=574, maxDocs=44218)
          0.02056547 = queryNorm
        0.47221628 = fieldWeight in 3822, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          5.3425174 = idf(docFreq=574, maxDocs=44218)
          0.0625 = fieldNorm(doc=3822)
    0.004756517 = weight(_text_:in in 3822) [ClassicSimilarity], result of:
      0.004756517 = score(doc=3822,freq=4.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.17003182 = fieldWeight in 3822, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0625 = fieldNorm(doc=3822)
    0.024276821 = weight(_text_:computer in 3822) [ClassicSimilarity], result of:
      0.024276821 = score(doc=3822,freq=2.0), product of:
        0.0751567 = queryWeight, product of:
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.02056547 = queryNorm
        0.32301605 = fieldWeight in 3822, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.0625 = fieldNorm(doc=3822)
    0.0063062985 = product of:
      0.012612597 = sum of:
        0.012612597 = weight(_text_:science in 3822) [ClassicSimilarity], result of:
          0.012612597 = score(doc=3822,freq=2.0), product of:
            0.0541719 = queryWeight, product of:
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.02056547 = queryNorm
            0.23282544 = fieldWeight in 3822, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.0625 = fieldNorm(doc=3822)
      0.5 = coord(1/2)
  0.22727273 = coord(5/22)

Abstract: The volume presents 26 revised papers corresponding to the oral presentations given at the conference, also included are refereed papers corresponding to the 30 poster presentations. These papers were selected from a total of 73 full draft submissions. The papers are organized in topical sections on rule evaluation, visualization, association rules and text mining, KDD process and software, tree construction, sequential and spatial data mining, and attribute selection
Series: Lecture notes in computer science; vol.1510

Hereth, J.; Stumme, G.; Wille, R.; Wille, U.: Conceptual knowledge discovery and data analysis (2000) 0.03

0.031490915 = product of:
  0.13856001 = sum of:
    0.06728067 = weight(_text_:lecture in 5083) [ClassicSimilarity], result of:
      0.06728067 = score(doc=5083,freq=4.0), product of:
        0.13308205 = queryWeight, product of:
          6.4711404 = idf(docFreq=185, maxDocs=44218)
          0.02056547 = queryNorm
        0.50555784 = fieldWeight in 5083, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          6.4711404 = idf(docFreq=185, maxDocs=44218)
          0.0390625 = fieldNorm(doc=5083)
    0.045858577 = weight(_text_:notes in 5083) [ClassicSimilarity], result of:
      0.045858577 = score(doc=5083,freq=4.0), product of:
        0.10987139 = queryWeight, product of:
          5.3425174 = idf(docFreq=574, maxDocs=44218)
          0.02056547 = queryNorm
        0.41738418 = fieldWeight in 5083, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          5.3425174 = idf(docFreq=574, maxDocs=44218)
          0.0390625 = fieldNorm(doc=5083)
    0.0063063093 = weight(_text_:in in 5083) [ClassicSimilarity], result of:
      0.0063063093 = score(doc=5083,freq=18.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.22543246 = fieldWeight in 5083, product of:
          4.2426405 = tf(freq=18.0), with freq of:
            18.0 = termFreq=18.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0390625 = fieldNorm(doc=5083)
    0.015173013 = weight(_text_:computer in 5083) [ClassicSimilarity], result of:
      0.015173013 = score(doc=5083,freq=2.0), product of:
        0.0751567 = queryWeight, product of:
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.02056547 = queryNorm
        0.20188503 = fieldWeight in 5083, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.0390625 = fieldNorm(doc=5083)
    0.0039414368 = product of:
      0.0078828735 = sum of:
        0.0078828735 = weight(_text_:science in 5083) [ClassicSimilarity], result of:
          0.0078828735 = score(doc=5083,freq=2.0), product of:
            0.0541719 = queryWeight, product of:
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.02056547 = queryNorm
            0.1455159 = fieldWeight in 5083, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.0390625 = fieldNorm(doc=5083)
      0.5 = coord(1/2)
  0.22727273 = coord(5/22)

Abstract: In this paper, we discuss Conceptual Knowledge Discovery in Databases (CKDD) in its connection with Data Analysis. Our approach is based on Formal Concept Analysis, a mathematical theory which has been developed and proven useful during the last 20 years. Formal Concept Analysis has led to a theory of conceptual information systems which has been applied by using the management system TOSCANA in a wide range of domains. In this paper, we use such an application in database marketing to demonstrate how methods and procedures of CKDD can be applied in Data Analysis. In particular, we show the interplay and integration of data mining and data analysis techniques based on Formal Concept Analysis. The main concern of this paper is to explain how the transition from data to knowledge can be supported by a TOSCANA system. To clarify the transition steps we discuss their correspondence to the five levels of knowledge representation established by R. Brachman and to the steps of empirically grounded theory building proposed by A. Strauss and J. Corbin
Series: Lecture notes in computer science; vol.1867: Lecture notes on artificial intelligence

Ester, M.; Sander, J.: Knowledge discovery in databases : Techniken und Anwendungen (2000) 0.02

0.018418472 = product of:
  0.101301596 = sum of:
    0.0473255 = weight(_text_:informatik in 1374) [ClassicSimilarity], result of:
      0.0473255 = score(doc=1374,freq=2.0), product of:
        0.104934774 = queryWeight, product of:
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.02056547 = queryNorm
        0.4509992 = fieldWeight in 1374, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.0625 = fieldNorm(doc=1374)
    0.023624685 = weight(_text_:und in 1374) [ClassicSimilarity], result of:
      0.023624685 = score(doc=1374,freq=14.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.51830536 = fieldWeight in 1374, product of:
          3.7416575 = tf(freq=14.0), with freq of:
            14.0 = termFreq=14.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=1374)
    0.023624685 = weight(_text_:und in 1374) [ClassicSimilarity], result of:
      0.023624685 = score(doc=1374,freq=14.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.51830536 = fieldWeight in 1374, product of:
          3.7416575 = tf(freq=14.0), with freq of:
            14.0 = termFreq=14.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=1374)
    0.00672673 = weight(_text_:in in 1374) [ClassicSimilarity], result of:
      0.00672673 = score(doc=1374,freq=8.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.24046129 = fieldWeight in 1374, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0625 = fieldNorm(doc=1374)
  0.18181819 = coord(4/22)

Abstract: Knowledge Discovery in Databases (KDD) ist ein aktuelles Forschungs- und Anwendungsgebiet der Informatik. Ziel des KDD ist es, selbständig entscheidungsrelevante, aber bisher unbekannte Zusammenhänge und Verknüpfungen in den Daten großer Datenmengen zu entdecken und dem Analysten oder dem Anwender in übersichtlicher Form zu präsentieren. Die Autoren stellen die Techniken und Anwendungen dieses interdisziplinären Gebiets anschaulich dar.
Content: Einleitung.- Statistik- und Datenbank-Grundlagen.Klassifikation.- Assoziationsregeln.- Generalisierung und Data Cubes.- Spatial-, Text-, Web-, Temporal-Data Mining. Ausblick.

Heyer, G.; Quasthoff, U.; Wittig, T.: Text Mining : Wissensrohstoff Text. Konzepte, Algorithmen, Ergebnisse (2006) 0.01
```
0.014626678 = product of:
  0.08044673 = sum of:
    0.033464182 = weight(_text_:informatik in 5218) [ClassicSimilarity], result of:
      0.033464182 = score(doc=5218,freq=4.0), product of:
        0.104934774 = queryWeight, product of:
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.02056547 = queryNorm
        0.3189046 = fieldWeight in 5218, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
    0.020459577 = weight(_text_:und in 5218) [ClassicSimilarity], result of:
      0.020459577 = score(doc=5218,freq=42.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.44886562 = fieldWeight in 5218, product of:
          6.4807405 = tf(freq=42.0), with freq of:
            42.0 = termFreq=42.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
    0.020459577 = weight(_text_:und in 5218) [ClassicSimilarity], result of:
      0.020459577 = score(doc=5218,freq=42.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.44886562 = fieldWeight in 5218, product of:
          6.4807405 = tf(freq=42.0), with freq of:
            42.0 = termFreq=42.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
    0.006063393 = weight(_text_:in in 5218) [ClassicSimilarity], result of:
      0.006063393 = score(doc=5218,freq=26.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.2167489 = fieldWeight in 5218, product of:
          5.0990195 = tf(freq=26.0), with freq of:
            26.0 = termFreq=26.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.03125 = fieldNorm(doc=5218)
  0.18181819 = coord(4/22)
```
Abstract

Ein großer Teil des Weltwissens befindet sich in Form digitaler Texte im Internet oder in Intranets. Heutige Suchmaschinen nutzen diesen Wissensrohstoff nur rudimentär: Sie können semantische Zusammen-hänge nur bedingt erkennen. Alle warten auf das semantische Web, in dem die Ersteller von Text selbst die Semantik einfügen. Das wird aber noch lange dauern. Es gibt jedoch eine Technologie, die es bereits heute ermöglicht semantische Zusammenhänge in Rohtexten zu analysieren und aufzubereiten. Das Forschungsgebiet "Text Mining" ermöglicht es mit Hilfe statistischer und musterbasierter Verfahren, Wissen aus Texten zu extrahieren, zu verarbeiten und zu nutzen. Hier wird die Basis für die Suchmaschinen der Zukunft gelegt. Das erste deutsche Lehrbuch zu einer bahnbrechenden Technologie: Text Mining: Wissensrohstoff Text Konzepte, Algorithmen, Ergebnisse Ein großer Teil des Weltwissens befindet sich in Form digitaler Texte im Internet oder in Intranets. Heutige Suchmaschinen nutzen diesen Wissensrohstoff nur rudimentär: Sie können semantische Zusammen-hänge nur bedingt erkennen. Alle warten auf das semantische Web, in dem die Ersteller von Text selbst die Semantik einfügen. Das wird aber noch lange dauern. Es gibt jedoch eine Technologie, die es bereits heute ermöglicht semantische Zusammenhänge in Rohtexten zu analysieren und aufzubereiten. Das For-schungsgebiet "Text Mining" ermöglicht es mit Hilfe statistischer und musterbasierter Verfahren, Wissen aus Texten zu extrahieren, zu verarbeiten und zu nutzen. Hier wird die Basis für die Suchmaschinen der Zukunft gelegt. Was fällt Ihnen bei dem Wort "Stich" ein? Die einen denken an Tennis, die anderen an Skat. Die verschiedenen Zusammenhänge können durch Text Mining automatisch ermittelt und in Form von Wortnetzen dargestellt werden. Welche Begriffe stehen am häufigsten links und rechts vom Wort "Festplatte"? Welche Wortformen und Eigennamen treten seit 2001 neu in der deutschen Sprache auf? Text Mining beantwortet diese und viele weitere Fragen. Tauchen Sie mit diesem Lehrbuch ein in eine neue, faszinierende Wissenschaftsdisziplin und entdecken Sie neue, bisher unbekannte Zusammenhänge und Sichtweisen. Sehen Sie, wie aus dem Wissensrohstoff Text Wissen wird! Dieses Lehrbuch richtet sich sowohl an Studierende als auch an Praktiker mit einem fachlichen Schwerpunkt in der Informatik, Wirtschaftsinformatik und/oder Linguistik, die sich über die Grundlagen, Verfahren und Anwendungen des Text Mining informieren möchten und Anregungen für die Implementierung eigener Anwendungen suchen. Es basiert auf Arbeiten, die während der letzten Jahre an der Abteilung Automatische Sprachverarbeitung am Institut für Informatik der Universität Leipzig unter Leitung von Prof. Dr. Heyer entstanden sind. Eine Fülle praktischer Beispiele von Text Mining-Konzepten und -Algorithmen verhelfen dem Leser zu einem umfassenden, aber auch detaillierten Verständnis der Grundlagen und Anwendungen des Text Mining. Folgende Themen werden behandelt: Wissen und Text Grundlagen der Bedeutungsanalyse Textdatenbanken Sprachstatistik Clustering Musteranalyse Hybride Verfahren Beispielanwendungen Anhänge: Statistik und linguistische Grundlagen 360 Seiten, 54 Abb., 58 Tabellen und 95 Glossarbegriffe Mit kostenlosen e-learning-Kurs "Schnelleinstieg: Sprachstatistik" Zusätzlich zum Buch gibt es in Kürze einen Online-Zertifikats-Kurs mit Mentor- und Tutorunterstützung.

Bauckhage, C.: Moderne Textanalyse : neues Wissen für intelligente Lösungen (2016) 0.01

0.014255795 = product of:
  0.07840687 = sum of:
    0.0473255 = weight(_text_:informatik in 2568) [ClassicSimilarity], result of:
      0.0473255 = score(doc=2568,freq=2.0), product of:
        0.104934774 = queryWeight, product of:
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.02056547 = queryNorm
        0.4509992 = fieldWeight in 2568, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.0625 = fieldNorm(doc=2568)
    0.012627926 = weight(_text_:und in 2568) [ClassicSimilarity], result of:
      0.012627926 = score(doc=2568,freq=4.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.27704588 = fieldWeight in 2568, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=2568)
    0.012627926 = weight(_text_:und in 2568) [ClassicSimilarity], result of:
      0.012627926 = score(doc=2568,freq=4.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.27704588 = fieldWeight in 2568, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=2568)
    0.0058255196 = weight(_text_:in in 2568) [ClassicSimilarity], result of:
      0.0058255196 = score(doc=2568,freq=6.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.2082456 = fieldWeight in 2568, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0625 = fieldNorm(doc=2568)
  0.18181819 = coord(4/22)

Abstract: Im Zuge der immer größeren Verfügbarkeit von Daten (Big Data) und rasanter Fortschritte im Daten-basierten maschinellen Lernen haben wir in den letzten Jahren Durchbrüche in der künstlichen Intelligenz erlebt. Dieser Vortrag beleuchtet diese Entwicklungen insbesondere im Hinblick auf die automatische Analyse von Textdaten. Anhand einfacher Beispiele illustrieren wir, wie moderne Textanalyse abläuft und zeigen wiederum anhand von Beispielen, welche praktischen Anwendungsmöglichkeiten sich heutzutage in Branchen wie dem Verlagswesen, der Finanzindustrie oder dem Consulting ergeben.
Field: Informatik

Survey of text mining : clustering, classification, and retrieval (2004) 0.01

0.014007981 = product of:
  0.07704389 = sum of:
    0.059156876 = weight(_text_:informatik in 804) [ClassicSimilarity], result of:
      0.059156876 = score(doc=804,freq=8.0), product of:
        0.104934774 = queryWeight, product of:
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.02056547 = queryNorm
        0.563749 = fieldWeight in 804, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.0390625 = fieldNorm(doc=804)
    0.007892453 = weight(_text_:und in 804) [ClassicSimilarity], result of:
      0.007892453 = score(doc=804,freq=4.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.17315367 = fieldWeight in 804, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=804)
    0.007892453 = weight(_text_:und in 804) [ClassicSimilarity], result of:
      0.007892453 = score(doc=804,freq=4.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.17315367 = fieldWeight in 804, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=804)
    0.0021021033 = weight(_text_:in in 804) [ClassicSimilarity], result of:
      0.0021021033 = score(doc=804,freq=2.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.07514416 = fieldWeight in 804, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0390625 = fieldNorm(doc=804)
  0.18181819 = coord(4/22)

Abstract: Extracting content from text continues to be an important research problem for information processing and management. Approaches to capture the semantics of text-based document collections may be based on Bayesian models, probability theory, vector space models, statistical models, or even graph theory. As the volume of digitized textual media continues to grow, so does the need for designing robust, scalable indexing and search strategies (software) to meet a variety of user needs. Knowledge extraction or creation from text requires systematic yet reliable processing that can be codified and adapted for changing needs and environments. This book will draw upon experts in both academia and industry to recommend practical approaches to the purification, indexing, and mining of textual information. It will address document identification, clustering and categorizing documents, cleaning text, and visualizing semantic models of text.
Classification: ST 270 Informatik / Monographien / Software und -entwicklung / Datenbanken, Datenbanksysteme, Data base management, Informationssysteme
ST 302 Informatik / Monographien / Künstliche Intelligenz / Expertensysteme; Wissensbasierte Systeme
RVK: ST 270 Informatik / Monographien / Software und -entwicklung / Datenbanken, Datenbanksysteme, Data base management, Informationssysteme
ST 302 Informatik / Monographien / Künstliche Intelligenz / Expertensysteme; Wissensbasierte Systeme

Jäger, L.: Von Big Data zu Big Brother (2018) 0.01

0.013444092 = product of:
  0.059154004 = sum of:
    0.02366275 = weight(_text_:informatik in 5234) [ClassicSimilarity], result of:
      0.02366275 = score(doc=5234,freq=2.0), product of:
        0.104934774 = queryWeight, product of:
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.02056547 = queryNorm
        0.2254996 = fieldWeight in 5234, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.03125 = fieldNorm(doc=5234)
    0.01411845 = weight(_text_:und in 5234) [ClassicSimilarity], result of:
      0.01411845 = score(doc=5234,freq=20.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.3097467 = fieldWeight in 5234, product of:
          4.472136 = tf(freq=20.0), with freq of:
            20.0 = termFreq=20.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=5234)
    0.01411845 = weight(_text_:und in 5234) [ClassicSimilarity], result of:
      0.01411845 = score(doc=5234,freq=20.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.3097467 = fieldWeight in 5234, product of:
          4.472136 = tf(freq=20.0), with freq of:
            20.0 = termFreq=20.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=5234)
    0.0016816825 = weight(_text_:in in 5234) [ClassicSimilarity], result of:
      0.0016816825 = score(doc=5234,freq=2.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.060115322 = fieldWeight in 5234, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.03125 = fieldNorm(doc=5234)
    0.005572675 = product of:
      0.01114535 = sum of:
        0.01114535 = weight(_text_:22 in 5234) [ClassicSimilarity], result of:
          0.01114535 = score(doc=5234,freq=2.0), product of:
            0.072016776 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02056547 = queryNorm
            0.15476047 = fieldWeight in 5234, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.03125 = fieldNorm(doc=5234)
      0.5 = coord(1/2)
  0.22727273 = coord(5/22)

Abstract: 1983 bewegte ein einziges Thema die gesamte Bundesrepublik: die geplante Volkszählung. Jeder Haushalt in Westdeutschland sollte Fragebögen mit 36 Fragen zur Wohnsituation, den im Haushalt lebenden Personen und über ihre Einkommensverhältnisse ausfüllen. Es regte sich massiver Widerstand, hunderte Bürgerinitiativen formierten sich im ganzen Land gegen die Befragung. Man wollte nicht "erfasst" werden, die Privatsphäre war heilig. Es bestand die (berechtigte) Sorge, dass die Antworten auf den eigentlich anonymisierten Fragebögen Rückschlüsse auf die Identität der Befragten zulassen. Das Bundesverfassungsgericht gab den Klägern gegen den Zensus Recht: Die geplante Volkszählung verstieß gegen den Datenschutz und damit auch gegen das Grundgesetz. Sie wurde gestoppt. Nur eine Generation später geben wir sorglos jedes Mal beim Einkaufen die Bonuskarte der Supermarktkette heraus, um ein paar Punkte für ein Geschenk oder Rabatte beim nächsten Einkauf zu sammeln. Und dabei wissen wir sehr wohl, dass der Supermarkt damit unser Konsumverhalten bis ins letzte Detail erfährt. Was wir nicht wissen, ist, wer noch Zugang zu diesen Daten erhält. Deren Käufer bekommen nicht nur Zugriff auf unsere Einkäufe, sondern können über sie auch unsere Gewohnheiten, persönlichen Vorlieben und Einkommen ermitteln. Genauso unbeschwert surfen wir im Internet, googeln und shoppen, mailen und chatten. Google, Facebook und Microsoft schauen bei all dem nicht nur zu, sondern speichern auf alle Zeiten alles, was wir von uns geben, was wir einkaufen, was wir suchen, und verwenden es für ihre eigenen Zwecke. Sie durchstöbern unsere E-Mails, kennen unser persönliches Zeitmanagement, verfolgen unseren momentanen Standort, wissen um unsere politischen, religiösen und sexuellen Präferenzen (wer kennt ihn nicht, den Button "an Männern interessiert" oder "an Frauen interessiert"?), unsere engsten Freunde, mit denen wir online verbunden sind, unseren Beziehungsstatus, welche Schule wir besuchen oder besucht haben und vieles mehr.
Date: 22. 1.2018 11:33:49
Field: Informatik

Witschel, H.F.: Text, Wörter, Morpheme : Möglichkeiten einer automatischen Terminologie-Extraktion (2004) 0.01

0.012600463 = product of:
  0.069302544 = sum of:
    0.04183023 = weight(_text_:informatik in 126) [ClassicSimilarity], result of:
      0.04183023 = score(doc=126,freq=4.0), product of:
        0.104934774 = queryWeight, product of:
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.02056547 = queryNorm
        0.39863077 = fieldWeight in 126, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
    0.011161615 = weight(_text_:und in 126) [ClassicSimilarity], result of:
      0.011161615 = score(doc=126,freq=8.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.24487628 = fieldWeight in 126, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
    0.011161615 = weight(_text_:und in 126) [ClassicSimilarity], result of:
      0.011161615 = score(doc=126,freq=8.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.24487628 = fieldWeight in 126, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
    0.00514908 = weight(_text_:in in 126) [ClassicSimilarity], result of:
      0.00514908 = score(doc=126,freq=12.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.18406484 = fieldWeight in 126, product of:
          3.4641016 = tf(freq=12.0), with freq of:
            12.0 = termFreq=12.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0390625 = fieldNorm(doc=126)
  0.18181819 = coord(4/22)

Abstract: Die vorliegende Arbeit beschäftigt sich mit einem Teilgebiet des TextMining, versucht also Information (in diesem Fall Fachterminologie) aus natürlichsprachlichem Text zu extrahieren. Die der Arbeit zugrundeliegende These besagt, daß in vielen Gebieten des Text Mining die Kombination verschiedener Methoden sinnvoll sein kann, um dem Facettenreichtum natürlicher Sprache gerecht zu werden. Die bei der Terminologie-Extraktion angewandten Methoden sind statistischer und linguistischer (bzw. musterbasierter) Natur. Um sie herzuleiten, wurden einige Eigenschaften von Fachtermini herausgearbeitet, die für deren Extraktion relevant sind. So läßt sich z.B. die Tatsache, daß viele Fachbegriffe Nominalphrasen einer bestimmten Form sind, direkt für eine Suche nach gewissen POS-Mustern ausnützen, die Verteilung von Termen in Fachtexten führte zu einem statistischen Ansatz - der Differenzanalyse. Zusammen mit einigen weiteren wurden diese Ansätze in ein Verfahren integriert, welches in der Lage ist, aus dem Feedback eines Anwenders zu lernen und in mehreren Schritten die Suche nach Terminologie zu verfeinern. Dabei wurden mehrere Parameter des Verfahrens veränderlich belassen, d.h. der Anwender kann sie beliebig anpassen. Bei der Untersuchung der Ergebnisse anhand von zwei Fachtexten aus unterschiedlichen Domänen wurde deutlich, daß sich zwar die verschiedenen Verfahren gut ergänzen, daß aber die optimalen Werte der veränderbaren Parameter, ja selbst die Auswahl der angewendeten Verfahren text- und domänenabhängig sind.
Imprint: Leipzig : Universität / Fakultät für Mathematik und Informatik Institut für Informatik

Wiegmann, S.: Hättest du die Titanic überlebt? : Eine kurze Einführung in das Data Mining mit freier Software (2023) 0.01

0.011262315 = product of:
  0.049554184 = sum of:
    0.015626261 = weight(_text_:und in 876) [ClassicSimilarity], result of:
      0.015626261 = score(doc=876,freq=8.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.34282678 = fieldWeight in 876, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0546875 = fieldNorm(doc=876)
    0.015626261 = weight(_text_:und in 876) [ClassicSimilarity], result of:
      0.015626261 = score(doc=876,freq=8.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.34282678 = fieldWeight in 876, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0546875 = fieldNorm(doc=876)
    0.009840704 = product of:
      0.019681407 = sum of:
        0.019681407 = weight(_text_:29 in 876) [ClassicSimilarity], result of:
          0.019681407 = score(doc=876,freq=2.0), product of:
            0.072342895 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02056547 = queryNorm
            0.27205724 = fieldWeight in 876, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.0546875 = fieldNorm(doc=876)
      0.5 = coord(1/2)
    0.0029429442 = weight(_text_:in in 876) [ClassicSimilarity], result of:
      0.0029429442 = score(doc=876,freq=2.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.10520181 = fieldWeight in 876, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0546875 = fieldNorm(doc=876)
    0.0055180113 = product of:
      0.011036023 = sum of:
        0.011036023 = weight(_text_:science in 876) [ClassicSimilarity], result of:
          0.011036023 = score(doc=876,freq=2.0), product of:
            0.0541719 = queryWeight, product of:
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.02056547 = queryNorm
            0.20372227 = fieldWeight in 876, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              2.6341193 = idf(docFreq=8627, maxDocs=44218)
              0.0546875 = fieldNorm(doc=876)
      0.5 = coord(1/2)
  0.22727273 = coord(5/22)

Abstract: Am 10. April 1912 ging Elisabeth Walton Allen an Bord der "Titanic", um ihr Hab und Gut nach England zu holen. Eines Nachts wurde sie von ihrer aufgelösten Tante geweckt, deren Kajüte unter Wasser stand. Wie steht es um Elisabeths Chancen und hätte man selbst das Unglück damals überlebt? Das Titanic-Orakel ist eine algorithmusbasierte App, die entsprechende Prognosen aufstellt und im Rahmen des Kurses "Data Science" am Department Information der HAW Hamburg entstanden ist. Dieser Beitrag zeigt Schritt für Schritt, wie die App unter Verwendung freier Software entwickelt wurde. Code und Daten werden zur Nachnutzung bereitgestellt.
Date: 28. 1.2022 11:05:29

Lackes, R.; Tillmanns, C.: Data Mining für die Unternehmenspraxis : Entscheidungshilfen und Fallstudien mit führenden Softwarelösungen (2006) 0.01

0.01005531 = product of:
  0.055304203 = sum of:
    0.022211334 = weight(_text_:und in 1383) [ClassicSimilarity], result of:
      0.022211334 = score(doc=1383,freq=22.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.48729765 = fieldWeight in 1383, product of:
          4.690416 = tf(freq=22.0), with freq of:
            22.0 = termFreq=22.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.022211334 = weight(_text_:und in 1383) [ClassicSimilarity], result of:
      0.022211334 = score(doc=1383,freq=22.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.48729765 = fieldWeight in 1383, product of:
          4.690416 = tf(freq=22.0), with freq of:
            22.0 = termFreq=22.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.0025225237 = weight(_text_:in in 1383) [ClassicSimilarity], result of:
      0.0025225237 = score(doc=1383,freq=2.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.09017298 = fieldWeight in 1383, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.046875 = fieldNorm(doc=1383)
    0.008359012 = product of:
      0.016718024 = sum of:
        0.016718024 = weight(_text_:22 in 1383) [ClassicSimilarity], result of:
          0.016718024 = score(doc=1383,freq=2.0), product of:
            0.072016776 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02056547 = queryNorm
            0.23214069 = fieldWeight in 1383, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.046875 = fieldNorm(doc=1383)
      0.5 = coord(1/2)
  0.18181819 = coord(4/22)

Abstract: Das Buch richtet sich an Praktiker in Unternehmen, die sich mit der Analyse von großen Datenbeständen beschäftigen. Nach einem kurzen Theorieteil werden vier Fallstudien aus dem Customer Relationship Management eines Versandhändlers bearbeitet. Dabei wurden acht führende Softwarelösungen verwendet: der Intelligent Miner von IBM, der Enterprise Miner von SAS, Clementine von SPSS, Knowledge Studio von Angoss, der Delta Miner von Bissantz, der Business Miner von Business Object und die Data Engine von MIT. Im Rahmen der Fallstudien werden die Stärken und Schwächen der einzelnen Lösungen deutlich, und die methodisch-korrekte Vorgehensweise beim Data Mining wird aufgezeigt. Beides liefert wertvolle Entscheidungshilfen für die Auswahl von Standardsoftware zum Data Mining und für die praktische Datenanalyse.
Content: Modelle, Methoden und Werkzeuge: Ziele und Aufbau der Untersuchung.- Grundlagen.- Planung und Entscheidung mit Data-Mining-Unterstützung.- Methoden.- Funktionalität und Handling der Softwarelösungen. Fallstudien: Ausgangssituation und Datenbestand im Versandhandel.- Kundensegmentierung.- Erklärung regionaler Marketingerfolge zur Neukundengewinnung.Prognose des Customer Lifetime Values.- Selektion von Kunden für eine Direktmarketingaktion.- Welche Softwarelösung für welche Entscheidung?- Fazit und Marktentwicklungen.
Date: 22. 3.2008 14:46:06

Keim, D.A.: Datenvisualisierung und Data Mining (2004) 0.01

0.008896398 = product of:
  0.04893019 = sum of:
    0.011161615 = weight(_text_:und in 2931) [ClassicSimilarity], result of:
      0.011161615 = score(doc=2931,freq=8.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.24487628 = fieldWeight in 2931, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
    0.011161615 = weight(_text_:und in 2931) [ClassicSimilarity], result of:
      0.011161615 = score(doc=2931,freq=8.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.24487628 = fieldWeight in 2931, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
    0.00514908 = weight(_text_:in in 2931) [ClassicSimilarity], result of:
      0.00514908 = score(doc=2931,freq=12.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.18406484 = fieldWeight in 2931, product of:
          3.4641016 = tf(freq=12.0), with freq of:
            12.0 = termFreq=12.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
    0.02145788 = weight(_text_:computer in 2931) [ClassicSimilarity], result of:
      0.02145788 = score(doc=2931,freq=4.0), product of:
        0.0751567 = queryWeight, product of:
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.02056547 = queryNorm
        0.28550854 = fieldWeight in 2931, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.0390625 = fieldNorm(doc=2931)
  0.18181819 = coord(4/22)

Abstract: Die rasante technologische Entwicklung der letzten zwei Jahrzehnte ermöglicht heute die persistente Speicherung riesiger Datenmengen durch den Computer. Forscher an der Universität Berkeley haben berechnet, dass jedes Jahr ca. 1 Exabyte (= 1 Million Terabyte) Daten generiert werden - ein großer Teil davon in digitaler Form. Das bedeutet aber, dass in den nächsten drei Jahren mehr Daten generiert werden als in der gesamten menschlichen Entwicklung zuvor. Die Daten werden oft automatisch mit Hilfe von Sensoren und Überwachungssystemen aufgezeichnet. So werden beispielsweise alltägliche Vorgänge des menschlichen Lebens, wie das Bezahlen mit Kreditkarte oder die Benutzung des Telefons, durch Computer aufgezeichnet. Dabei werden gewöhnlich alle verfügbaren Parameter abgespeichert, wodurch hochdimensionale Datensätze entstehen. Die Daten werden gesammelt, da sie wertvolle Informationen enthalten, die einen Wettbewerbsvorteil bieten können. Das Finden der wertvollen Informationen in den großen Datenmengen ist aber keine leichte Aufgabe. Heutige Datenbankmanagementsysteme können nur kleine Teilmengen dieser riesigen Datenmengen darstellen. Werden die Daten zum Beispiel in textueller Form ausgegeben, können höchstens ein paar hundert Zeilen auf dem Bildschirm dargestellt werden. Bei Millionen von Datensätzen ist dies aber nur ein Tropfen auf den heißen Stein.
Source: Grundlagen der praktischen Information und Dokumentation. 5., völlig neu gefaßte Ausgabe. 2 Bde. Hrsg. von R. Kuhlen, Th. Seeger u. D. Strauch. Begründet von Klaus Laisiepen, Ernst Lutterbeck, Karl-Heinrich Meyer-Uhlenried. Bd.1: Handbuch zur Einführung in die Informationswissenschaft und -praxis

Witten, I.H.; Frank, E.: Data Mining : Praktische Werkzeuge und Techniken für das maschinelle Lernen (2000) 0.01

0.008855037 = product of:
  0.048702702 = sum of:
    0.013393938 = weight(_text_:und in 6833) [ClassicSimilarity], result of:
      0.013393938 = score(doc=6833,freq=2.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.29385152 = fieldWeight in 6833, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.09375 = fieldNorm(doc=6833)
    0.013393938 = weight(_text_:und in 6833) [ClassicSimilarity], result of:
      0.013393938 = score(doc=6833,freq=2.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.29385152 = fieldWeight in 6833, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.09375 = fieldNorm(doc=6833)
    0.016869778 = product of:
      0.033739556 = sum of:
        0.033739556 = weight(_text_:29 in 6833) [ClassicSimilarity], result of:
          0.033739556 = score(doc=6833,freq=2.0), product of:
            0.072342895 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02056547 = queryNorm
            0.46638384 = fieldWeight in 6833, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.09375 = fieldNorm(doc=6833)
      0.5 = coord(1/2)
    0.0050450475 = weight(_text_:in in 6833) [ClassicSimilarity], result of:
      0.0050450475 = score(doc=6833,freq=2.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.18034597 = fieldWeight in 6833, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.09375 = fieldNorm(doc=6833)
  0.18181819 = coord(4/22)

Date: 27. 1.1996 10:29:55
Footnote: Rez. in: nfd 52(2001), H.7, S.427-428 (T. Mandl)

Medien-Informationsmanagement : Archivarische, dokumentarische, betriebswirtschaftliche, rechtliche und Berufsbild-Aspekte ; [Frühjahrstagung der Fachgruppe 7 im Jahr 2000 in Weimar und Folgetagung 2001 in Köln] (2003) 0.01
```
0.008647454 = product of:
  0.047560997 = sum of:
    0.018941889 = weight(_text_:und in 1833) [ClassicSimilarity], result of:
      0.018941889 = score(doc=1833,freq=64.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.41556883 = fieldWeight in 1833, product of:
          8.0 = tf(freq=64.0), with freq of:
            64.0 = termFreq=64.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.018941889 = weight(_text_:und in 1833) [ClassicSimilarity], result of:
      0.018941889 = score(doc=1833,freq=64.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.41556883 = fieldWeight in 1833, product of:
          8.0 = tf(freq=64.0), with freq of:
            64.0 = termFreq=64.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.005497713 = weight(_text_:in in 1833) [ClassicSimilarity], result of:
      0.005497713 = score(doc=1833,freq=38.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.19652747 = fieldWeight in 1833, product of:
          6.164414 = tf(freq=38.0), with freq of:
            38.0 = termFreq=38.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0234375 = fieldNorm(doc=1833)
    0.004179506 = product of:
      0.008359012 = sum of:
        0.008359012 = weight(_text_:22 in 1833) [ClassicSimilarity], result of:
          0.008359012 = score(doc=1833,freq=2.0), product of:
            0.072016776 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02056547 = queryNorm
            0.116070345 = fieldWeight in 1833, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.0234375 = fieldNorm(doc=1833)
      0.5 = coord(1/2)
  0.18181819 = coord(4/22)
```
Abstract

Als in den siebziger Jahren des vergangenen Jahrhunderts immer häufiger die Bezeichnung Informationsmanager für Leute propagiert wurde, die bis dahin als Dokumentare firmierten, wurde dies in den etablierten Kreisen der Archivare und Bibliothekare gelegentlich belächelt und als Zeichen einer Identitätskrise oder jedenfalls einer Verunsicherung des damit überschriebenen Berufsbilds gewertet. Für den Berufsstand der Medienarchivare/Mediendokumentare, die sich seit 1960 in der Fachgruppe 7 des Vereins, später Verbands deutscher Archivare (VdA) organisieren, gehörte diese Verortung im Zeichen neuer inhaltlicher Herausforderungen (Informationsflut) und Technologien (EDV) allerdings schon früh zu den Selbstverständlichkeiten des Berufsalltags. "Halt, ohne uns geht es nicht!" lautete die Überschrift eines Artikels im Verbandsorgan "Info 7", der sich mit der Einrichtung von immer mächtigeren Leitungsnetzen und immer schnelleren Datenautobahnen beschäftigte. Information, Informationsgesellschaft: diese Begriffe wurden damals fast nur im technischen Sinne verstanden. Die informatisierte, nicht die informierte Gesellschaft stand im Vordergrund - was wiederum Kritiker auf den Plan rief, von Joseph Weizenbaum in den USA bis hin zu den Informations-Ökologen in Bremen. Bei den nationalen, manchmal auch nur regionalen Projekten und Modellversuchen mit Datenautobahnen - auch beim frühen Btx - war nie so recht deutlich geworden, welche Inhalte in welcher Gestalt durch diese Netze und Straßen gejagt werden sollten und wer diese Inhalte eigentlich selektieren, portionieren, positionieren, kurz: managen sollte. Spätestens mit dem World Wide Web sind diese Projekte denn auch obsolet geworden, jedenfalls was die Hardware und Software anging. Geblieben ist das Thema Inhalte (neudeutsch: Content). Und - immer drängender im nicht nur technischen Verständnis - das Thema Informationsmanagement. MedienInformationsManagement war die Frühjahrstagung der Fachgruppe 7 im Jahr 2000 in Weimar überschrieben, und auch die Folgetagung 2001 in Köln, die der multimedialen Produktion einen dokumentarischen Pragmatismus gegenüber stellte, handelte vom Geschäftsfeld Content und von Content-Management-Systemen. Die in diesem 6. Band der Reihe Beiträge zur Mediendokumentation versammelten Vorträge und Diskussionsbeiträge auf diesen beiden Tagungen beleuchten das Titel-Thema aus den verschiedensten Blickwinkeln: archivarischen, dokumentarischen, kaufmännischen, berufsständischen und juristischen. Deutlich wird dabei, daß die Berufsbezeichnung Medienarchivarln/Mediendokumentarln ziemlich genau für all das steht, was heute mit sog. alten wie neuen Medien im organisatorischen, d.h. ordnenden und vermittelnden Sinne geschieht. Im besonderen Maße trifft dies auf das Internet und die aus ihm geborenen Intranets zu. Beide bedürfen genauso der ordnenden Hand, die sich an den alten Medien, an Buch, Zeitung, Tonträger, Film etc. geschult hat, denn sie leben zu großen Teilen davon. Daß das Internet gleichwohl ein Medium sui generis ist und die alten Informationsberufe vor ganz neue Herausforderungen stellt - auch das durchzieht die Beiträge von Weimar und Köln.
Vorliegender Band umgreift den gegenwärtigen Stand der Diskussion um das Handling von Informationen in und mit Hilfe von neuen und alten Medien und liefert außerdem dem Verein Fortbildung für Medienarchivare/ Mediendokumentare (VFM), der seit dem 5. Band die Reihe herausgibt, eine weitere Handreichung für die zusammen mit dem Deutschen Institut, für publizistische Bildungsarbeit in Hagen veranstalteten Seminare. Im Anhang sind außer den vollständigen Programmen der beiden Frühjahrstagungen die Namen und institutionellen Anbindungen der Referenten nachzulesen. Allen Autoren des Bandes sei für ihre Bereitschaft, an dieser Publikation mitzuwirken, gedankt, insbesondere denen, die sich auch noch der Mühe unterziehen mußten, das Transkript ihres in freier Rede gehaltenen Vortrags in eine lesbare Fassung zu bringen. Manche Eigentümlichkeiten des Stils sind dieser freien Rede geschuldet - oder vielleicht auch gedankt, denn sie geben damit umso lebendiger die Atmosphäre jener Frühlingstage in Weimar und Köln wieder.

Classification

AP 11500 Allgemeines / Medien- und Kommunikationswissenschaften, Kommunikationsdesign / Bibliographien und Sammelschriften / Tagungs- und Kongreßberichte (CSN)

Content

Enthält u.a. die Beiträge (Dokumentarische Aspekte): Günter Perers/Volker Gaese: Das DocCat-System in der Textdokumentation von Gr+J (Weimar 2000) Thomas Gerick: Finden statt suchen. Knowledge Retrieval in Wissensbanken. Mit organisiertem Wissen zu mehr Erfolg (Weimar 2000) Winfried Gödert: Aufbereitung und Rezeption von Information (Weimar 2000) Elisabeth Damen: Klassifikation als Ordnungssystem im elektronischen Pressearchiv (Köln 2001) Clemens Schlenkrich: Aspekte neuer Regelwerksarbeit - Multimediales Datenmodell für ARD und ZDF (Köln 2001) Josef Wandeler: Comprenez-vous only Bahnhof'? - Mehrsprachigkeit in der Mediendokumentation (Köln 200 1)

Date

11. 5.2008 19:49:22

RVK

AP 11500 Allgemeines / Medien- und Kommunikationswissenschaften, Kommunikationsdesign / Bibliographien und Sammelschriften / Tagungs- und Kongreßberichte (CSN)

Fonseca, F.; Marcinkowski, M.; Davis, C.: Cyber-human systems of thought and understanding (2019) 0.01

0.008436015 = product of:
  0.061864108 = sum of:
    0.029578438 = weight(_text_:informatik in 5011) [ClassicSimilarity], result of:
      0.029578438 = score(doc=5011,freq=2.0), product of:
        0.104934774 = queryWeight, product of:
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.02056547 = queryNorm
        0.2818745 = fieldWeight in 5011, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          5.1024737 = idf(docFreq=730, maxDocs=44218)
          0.0390625 = fieldNorm(doc=5011)
    0.004700446 = weight(_text_:in in 5011) [ClassicSimilarity], result of:
      0.004700446 = score(doc=5011,freq=10.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.16802745 = fieldWeight in 5011, product of:
          3.1622777 = tf(freq=10.0), with freq of:
            10.0 = termFreq=10.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0390625 = fieldNorm(doc=5011)
    0.027585223 = sum of:
      0.013653537 = weight(_text_:science in 5011) [ClassicSimilarity], result of:
        0.013653537 = score(doc=5011,freq=6.0), product of:
          0.0541719 = queryWeight, product of:
            2.6341193 = idf(docFreq=8627, maxDocs=44218)
            0.02056547 = queryNorm
          0.25204095 = fieldWeight in 5011, product of:
            2.4494898 = tf(freq=6.0), with freq of:
              6.0 = termFreq=6.0
            2.6341193 = idf(docFreq=8627, maxDocs=44218)
            0.0390625 = fieldNorm(doc=5011)
      0.013931687 = weight(_text_:22 in 5011) [ClassicSimilarity], result of:
        0.013931687 = score(doc=5011,freq=2.0), product of:
          0.072016776 = queryWeight, product of:
            3.5018296 = idf(docFreq=3622, maxDocs=44218)
            0.02056547 = queryNorm
          0.19345059 = fieldWeight in 5011, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            3.5018296 = idf(docFreq=3622, maxDocs=44218)
            0.0390625 = fieldNorm(doc=5011)
  0.13636364 = coord(3/22)

Abstract: The present challenge faced by scientists working with Big Data comes in the overwhelming volume and level of detail provided by current data sets. Exceeding traditional empirical approaches, Big Data opens a new perspective on scientific work in which data comes to play a role in the development of the scientific problematic to be developed. Addressing this reconfiguration of our relationship with data through readings of Wittgenstein, Macherey, and Popper, we propose a picture of science that encourages scientists to engage with the data in a direct way, using the data itself as an instrument for scientific investigation. Using GIS as a theme, we develop the concept of cyber-human systems of thought and understanding to bridge the divide between representative (theoretical) thinking and (non-theoretical) data-driven science. At the foundation of these systems, we invoke the concept of the "semantic pixel" to establish a logical and virtual space linking data and the work of scientists. It is with this discussion of the relationship between analysts in their pursuit of knowledge and the rise of Big Data that this present discussion of the philosophical foundations of Big Data addresses the central questions raised by social informatics research.
Date: 7. 3.2019 16:32:22
Field: Informatik
Source: Journal of the Association for Information Science and Technology. 70(2019) no.4, S.402-411

Hofstede, A.H.M. ter; Proper, H.A.; Van der Weide, T.P.: Exploiting fact verbalisation in conceptual information modelling (1997) 0.01

0.008351351 = product of:
  0.04593243 = sum of:
    0.009840704 = product of:
      0.019681407 = sum of:
        0.019681407 = weight(_text_:29 in 2908) [ClassicSimilarity], result of:
          0.019681407 = score(doc=2908,freq=2.0), product of:
            0.072342895 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02056547 = queryNorm
            0.27205724 = fieldWeight in 2908, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.0546875 = fieldNorm(doc=2908)
      0.5 = coord(1/2)
    0.0050973296 = weight(_text_:in in 2908) [ClassicSimilarity], result of:
      0.0050973296 = score(doc=2908,freq=6.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.1822149 = fieldWeight in 2908, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0546875 = fieldNorm(doc=2908)
    0.021242218 = weight(_text_:computer in 2908) [ClassicSimilarity], result of:
      0.021242218 = score(doc=2908,freq=2.0), product of:
        0.0751567 = queryWeight, product of:
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.02056547 = queryNorm
        0.28263903 = fieldWeight in 2908, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          3.6545093 = idf(docFreq=3109, maxDocs=44218)
          0.0546875 = fieldNorm(doc=2908)
    0.00975218 = product of:
      0.01950436 = sum of:
        0.01950436 = weight(_text_:22 in 2908) [ClassicSimilarity], result of:
          0.01950436 = score(doc=2908,freq=2.0), product of:
            0.072016776 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02056547 = queryNorm
            0.2708308 = fieldWeight in 2908, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.0546875 = fieldNorm(doc=2908)
      0.5 = coord(1/2)
  0.18181819 = coord(4/22)

Abstract: Focuses on the information modelling side of conceptual modelling. Deals with the exploitation of fact verbalisations after finishing the actual information system. Verbalisations are used as input for the design of the so-called information model. Exploits these verbalisation in 4 directions: considers their use for a conceptual query language, the verbalisation of instances, the description of the contents of a database and for the verbalisation of queries in a computer supported query environment. Provides an example session with an envisioned tool for end user query formulations that exploits the verbalisation
Date: 5. 4.1996 15:29:15
Source: Information systems. 22(1997) nos.5/6, S.349-385

Lusti, M.: Data Warehousing and Data Mining : Eine Einführung in entscheidungsunterstützende Systeme (1999) 0.01

0.008261943 = product of:
  0.04544069 = sum of:
    0.015465987 = weight(_text_:und in 4261) [ClassicSimilarity], result of:
      0.015465987 = score(doc=4261,freq=6.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.33931053 = fieldWeight in 4261, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=4261)
    0.015465987 = weight(_text_:und in 4261) [ClassicSimilarity], result of:
      0.015465987 = score(doc=4261,freq=6.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.33931053 = fieldWeight in 4261, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.0625 = fieldNorm(doc=4261)
    0.003363365 = weight(_text_:in in 4261) [ClassicSimilarity], result of:
      0.003363365 = score(doc=4261,freq=2.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.120230645 = fieldWeight in 4261, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.0625 = fieldNorm(doc=4261)
    0.01114535 = product of:
      0.0222907 = sum of:
        0.0222907 = weight(_text_:22 in 4261) [ClassicSimilarity], result of:
          0.0222907 = score(doc=4261,freq=2.0), product of:
            0.072016776 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02056547 = queryNorm
            0.30952093 = fieldWeight in 4261, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.0625 = fieldNorm(doc=4261)
      0.5 = coord(1/2)
  0.18181819 = coord(4/22)

Abstract: Im Mittelpunkt dieses anwendungsbezogenen Lehrbuchs stehen Architekturen, Methoden und Werkzeuge entscheidungsunterstützender Systeme. Beispiele und Aufgaben ermöglichen die Entwicklung von Anwendungen mit der Demonstrationssoftware der CD-ROM. Eine interaktive Foliensammlung veranschaulicht den Buchtext und verweist auf zusätzliches Lernmaterial
Date: 17. 7.2002 19:22:06

Wrobel, S.: Lern- und Entdeckungsverfahren (2002) 0.01

0.0074663945 = product of:
  0.054753557 = sum of:
    0.018941889 = weight(_text_:und in 1105) [ClassicSimilarity], result of:
      0.018941889 = score(doc=1105,freq=4.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.41556883 = fieldWeight in 1105, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.09375 = fieldNorm(doc=1105)
    0.018941889 = weight(_text_:und in 1105) [ClassicSimilarity], result of:
      0.018941889 = score(doc=1105,freq=4.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.41556883 = fieldWeight in 1105, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.09375 = fieldNorm(doc=1105)
    0.016869778 = product of:
      0.033739556 = sum of:
        0.033739556 = weight(_text_:29 in 1105) [ClassicSimilarity], result of:
          0.033739556 = score(doc=1105,freq=2.0), product of:
            0.072342895 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02056547 = queryNorm
            0.46638384 = fieldWeight in 1105, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.09375 = fieldNorm(doc=1105)
      0.5 = coord(1/2)
  0.13636364 = coord(3/22)

Abstract: Betrügerische Kreditkartenkäufe, besonders fähige Basketballspieler und umweltbewusste Saftverkäufer ausfindig machen - Data-Mining-Verfahren lernen selbständig das Wesentliche
Date: 31.12.1996 19:29:41

Peters, G.; Gaese, V.: ¬Das DocCat-System in der Textdokumentation von G+J (2003) 0.01
```
0.0073861657 = product of:
  0.04062391 = sum of:
    0.015465987 = weight(_text_:und in 1507) [ClassicSimilarity], result of:
      0.015465987 = score(doc=1507,freq=24.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.33931053 = fieldWeight in 1507, product of:
          4.8989797 = tf(freq=24.0), with freq of:
            24.0 = termFreq=24.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.015465987 = weight(_text_:und in 1507) [ClassicSimilarity], result of:
      0.015465987 = score(doc=1507,freq=24.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.33931053 = fieldWeight in 1507, product of:
          4.8989797 = tf(freq=24.0), with freq of:
            24.0 = termFreq=24.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.0041192644 = weight(_text_:in in 1507) [ClassicSimilarity], result of:
      0.0041192644 = score(doc=1507,freq=12.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.14725187 = fieldWeight in 1507, product of:
          3.4641016 = tf(freq=12.0), with freq of:
            12.0 = termFreq=12.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.03125 = fieldNorm(doc=1507)
    0.005572675 = product of:
      0.01114535 = sum of:
        0.01114535 = weight(_text_:22 in 1507) [ClassicSimilarity], result of:
          0.01114535 = score(doc=1507,freq=2.0), product of:
            0.072016776 = queryWeight, product of:
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.02056547 = queryNorm
            0.15476047 = fieldWeight in 1507, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5018296 = idf(docFreq=3622, maxDocs=44218)
              0.03125 = fieldNorm(doc=1507)
      0.5 = coord(1/2)
  0.18181819 = coord(4/22)
```
Abstract

Wir werden einmal die Grundlagen des Text-Mining-Systems bei IBM darstellen, dann werden wir das Projekt etwas umfangreicher und deutlicher darstellen, da kennen wir uns aus. Von daher haben wir zwei Teile, einmal Heidelberg, einmal Hamburg. Noch einmal zur Technologie. Text-Mining ist eine von IBM entwickelte Technologie, die in einer besonderen Ausformung und Programmierung für uns zusammengestellt wurde. Das Projekt hieß bei uns lange Zeit DocText Miner und heißt seit einiger Zeit auf Vorschlag von IBM DocCat, das soll eine Abkürzung für Document-Categoriser sein, sie ist ja auch nett und anschaulich. Wir fangen an mit Text-Mining, das bei IBM in Heidelberg entwickelt wurde. Die verstehen darunter das automatische Indexieren als eine Instanz, also einen Teil von Text-Mining. Probleme werden dabei gezeigt, und das Text-Mining ist eben eine Methode zur Strukturierung von und der Suche in großen Dokumentenmengen, die Extraktion von Informationen und, das ist der hohe Anspruch, von impliziten Zusammenhängen. Das letztere sei dahingestellt. IBM macht das quantitativ, empirisch, approximativ und schnell. das muss man wirklich sagen. Das Ziel, und das ist ganz wichtig für unser Projekt gewesen, ist nicht, den Text zu verstehen, sondern das Ergebnis dieser Verfahren ist, was sie auf Neudeutsch a bundle of words, a bag of words nennen, also eine Menge von bedeutungstragenden Begriffen aus einem Text zu extrahieren, aufgrund von Algorithmen, also im Wesentlichen aufgrund von Rechenoperationen. Es gibt eine ganze Menge von linguistischen Vorstudien, ein wenig Linguistik ist auch dabei, aber nicht die Grundlage der ganzen Geschichte. Was sie für uns gemacht haben, ist also die Annotierung von Pressetexten für unsere Pressedatenbank. Für diejenigen, die es noch nicht kennen: Gruner + Jahr führt eine Textdokumentation, die eine Datenbank führt, seit Anfang der 70er Jahre, da sind z.Z. etwa 6,5 Millionen Dokumente darin, davon etwas über 1 Million Volltexte ab 1993. Das Prinzip war lange Zeit, dass wir die Dokumente, die in der Datenbank gespeichert waren und sind, verschlagworten und dieses Prinzip haben wir auch dann, als der Volltext eingeführt wurde, in abgespeckter Form weitergeführt. Zu diesen 6,5 Millionen Dokumenten gehören dann eben auch ungefähr 10 Millionen Faksimileseiten, weil wir die Faksimiles auch noch standardmäßig aufheben.

Date

22. 4.2003 11:45:36

Source

Medien-Informationsmanagement: Archivarische, dokumentarische, betriebswirtschaftliche, rechtliche und Berufsbild-Aspekte. Hrsg.: Marianne Englert u.a

Borgelt, C.; Kruse, R.: Unsicheres Wissen nutzen (2002) 0.01

0.0073791975 = product of:
  0.040585585 = sum of:
    0.011161615 = weight(_text_:und in 1104) [ClassicSimilarity], result of:
      0.011161615 = score(doc=1104,freq=2.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.24487628 = fieldWeight in 1104, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.078125 = fieldNorm(doc=1104)
    0.011161615 = weight(_text_:und in 1104) [ClassicSimilarity], result of:
      0.011161615 = score(doc=1104,freq=2.0), product of:
        0.04558063 = queryWeight, product of:
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.02056547 = queryNorm
        0.24487628 = fieldWeight in 1104, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.216367 = idf(docFreq=13101, maxDocs=44218)
          0.078125 = fieldNorm(doc=1104)
    0.014058149 = product of:
      0.028116299 = sum of:
        0.028116299 = weight(_text_:29 in 1104) [ClassicSimilarity], result of:
          0.028116299 = score(doc=1104,freq=2.0), product of:
            0.072342895 = queryWeight, product of:
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.02056547 = queryNorm
            0.38865322 = fieldWeight in 1104, product of:
              1.4142135 = tf(freq=2.0), with freq of:
                2.0 = termFreq=2.0
              3.5176873 = idf(docFreq=3565, maxDocs=44218)
              0.078125 = fieldNorm(doc=1104)
      0.5 = coord(1/2)
    0.0042042066 = weight(_text_:in in 1104) [ClassicSimilarity], result of:
      0.0042042066 = score(doc=1104,freq=2.0), product of:
        0.027974274 = queryWeight, product of:
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.02056547 = queryNorm
        0.15028831 = fieldWeight in 1104, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          1.3602545 = idf(docFreq=30841, maxDocs=44218)
          0.078125 = fieldNorm(doc=1104)
  0.18181819 = coord(4/22)

Abstract: Probabilistische Schlussfolgerungsnetze sind ein probates Mittel, unsicheres Wissen sauber und mathematisch fundiert zu verarbeiten. In neuerer Zeit wurden Verfahren entwickelt, um sie automatisch aus Beispieldaten zu erlernen
Date: 31.12.1996 19:29:41

Search (168 results, page 1 of 9)

Authors

Years

Languages

Types

Themes

Subjects

Classifications