Document (#24924)

Author: Seidenfaden, U.
Title: Schürfen in Datenbergen : Data-Mining soll möglichst viel Information zu Tage fördern
Source: Süddeutsche Zeitung. Nr.xxx vom 13.11.2001, S.xx
Year: 2001
Content: "Fast alles wird heute per Computer erfasst. Kaum einer überblickt noch die enormen Datenmengen, die sich in Unternehmen, Universitäten und Verwaltung ansammeln. Allein in den öffentlich zugänglichen Datenbanken der Genforscher fallen pro Woche rund 4,5 Gigabyte an neuer Information an. "Vom potentiellen Wissen in den Datenbanken wird bislang aber oft nur ein Teil genutzt", meint Stefan Wrobel vom Lehrstuhl für Wissensentdeckung und Maschinelles Lernen der Otto-von-Guericke-Universität in Magdeburg. Sein Doktorand Mark-Andre Krogel hat soeben mit einem neuen Verfahren zur Datenbankrecherche in San Francisco einen inoffiziellen Weltmeister-Titel in der Disziplin "Data-Mining" gewonnen. Dieser Daten-Bergbau arbeitet im Unterschied zur einfachen Datenbankabfrage, die sich einfacher statistischer Methoden bedient, zusätzlich mit künstlicher Intelligenz und Visualisierungsverfahren, um Querverbindungen zu finden. "Das erleichtert die Suche nach verborgenen Zusammenhängen im Datenmaterial ganz erheblich", so Wrobel. Die Wirtschaft setzt Data-Mining bereits ein, um das Kundenverhalten zu untersuchen und vorherzusagen. "Stellen sie sich ein Unternehmen mit einer breiten Produktpalette und einem großen Kundenstamm vor", erklärt Wrobel. "Es kann seinen Erfolg maximieren, wenn es Marketing-Post zielgerichtet an seine Kunden verschickt. Wer etwa gerade einen PC gekauft hat, ist womöglich auch an einem Drucker oder Scanner interessiert." In einigen Jahren könnte ein Analysemodul den Manager eines Unternehmens selbständig informieren, wenn ihm etwas Ungewöhnliches aufgefallen ist. Das muss nicht immer positiv für den Kunden sein. Data-Mining ließe sich auch verwenden, um die Lebensdauer von Geschäftsbeziehungen zu prognostizieren. Für Kunden mit geringen Kaufinteressen würden Reklamationen dann längere Bearbeitungszeiten nach sich ziehen. Im konkreten Projekt von Mark-Andre Krogel ging es um die Vorhersage von Protein-Funktionen. Proteine sind Eiweißmoleküle, die fast alle Stoffwechselvorgänge im menschlichen Körper steuern. Sie sind daher die primären Ziele von Wirkstoffen zur Behandlung von Erkrankungen. Das erklärt das große Interesse der Pharmaindustrie. Experimentelle Untersuchungen, die Aufschluss über die Aufgaben der über 100 000 Eiweißmoleküle im menschlichen Körper geben können, sind mit einem hohen Zeitaufwand verbunden. Die Forscher möchten deshalb die Zeit verkürzen, indem sie das vorhandene Datenmaterial mit Hilfe von Data-Mining auswerten. Aus der im Humangenomprojekt bereits entschlüsselten Abfolge der Erbgut-Bausteine lässt sich per Datenbankanalyse die Aneinanderreihung bestimmter Aminosäuren zu einem Protein vorhersagen. Andere Datenbanken wiederum enthalten Informationen, welche Struktur ein Protein mit einer bestimmten vorgegebenen Funktion haben könnte. Aus bereits bekannten Strukturelementen versuchen die Genforscher dann, auf die mögliche Funktion eines bislang noch unbekannten Eiweißmoleküls zu schließen.- Fakten Verschmelzen - Bei diesem theoretischen Ansatz kommt es darauf an, die in Datenbanken enthaltenen Informationen so zu verknüpfen, dass die Ergebnisse mit hoher Wahrscheinlichkeit mit der Realität übereinstimmen. "Im Rahmen des Wettbewerbs erhielten wir Tabellen als Vorgabe, in denen Gene und Chromosomen nach bestimmten Gesichtspunkten klassifiziert waren", erläutert Krogel. Von einigen Genen war bekannt, welche Proteine sie produzieren und welche Aufgabe diese Eiweißmoleküle besitzen. Diese Beispiele dienten dem von Krogel entwickelten Programm dann als Hilfe, für andere Gene vorherzusagen, welche Funktionen die von ihnen erzeugten Proteine haben. "Die Genauigkeit der Vorhersage lag bei den gestellten Aufgaben bei über 90 Prozent", stellt Krogel fest. Allerdings könne man in der Praxis nicht davon ausgehen, dass alle Informationen aus verschiedenen Datenbanken in einem einheitlichen Format vorliegen. Es gebe verschiedene Abfragesprachen der Datenbanken, und die Bezeichnungen von Eiweißmolekülen mit gleicher Aufgabe seien oftmals uneinheitlich. Die Magdeburger Informatiker arbeiten deshalb in der DFG-Forschergruppe "Informationsfusion" an Methoden, um die verschiedenen Datenquellen besser zu erschließen."
Footnote: Vgl. auch: kd.cs.uni-magdeburg.de; www.acm.org/sigkdd/kdd2001
Theme: Data Mining

Similar documents (content)

Keim, D.A.: Data Mining mit bloßem Auge (2002) 0.45

0.4543249 = sum of:
  0.4543249 = product of:
    1.2115331 = sum of:
      0.078720644 = weight(abstract_txt:data in 1086) [ClassicSimilarity], result of:
        0.078720644 = score(doc=1086,freq=1.0), product of:
          0.09437942 = queryWeight, product of:
            1.3781172 = boost
            3.3363478 = idf(docFreq=4274, maxDocs=44218)
            0.020526731 = queryNorm
          0.83408695 = fieldWeight in 1086, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            3.3363478 = idf(docFreq=4274, maxDocs=44218)
            0.25 = fieldNorm(doc=1086)
      0.4992011 = weight(abstract_txt:mining in 1086) [ClassicSimilarity], result of:
        0.4992011 = score(doc=1086,freq=1.0), product of:
          0.3233468 = queryWeight, product of:
            2.5508316 = boost
            6.1754265 = idf(docFreq=249, maxDocs=44218)
            0.020526731 = queryNorm
          1.5438566 = fieldWeight in 1086, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            6.1754265 = idf(docFreq=249, maxDocs=44218)
            0.25 = fieldNorm(doc=1086)
      0.6336113 = weight(abstract_txt:möglichst in 1086) [ClassicSimilarity], result of:
        0.6336113 = score(doc=1086,freq=1.0), product of:
          0.3790532 = queryWeight, product of:
            2.7618341 = boost
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.020526731 = queryNorm
          1.671563 = fieldWeight in 1086, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.25 = fieldNorm(doc=1086)
    0.375 = coord(3/8)

Eversberg, B.: allegro und RDBMS : vergleichende Gegenüberstellung (2000) 0.34

0.34125644 = sum of:
  0.34125644 = product of:
    0.6825129 = sum of:
      0.1082226 = weight(abstract_txt:soll in 974) [ClassicSimilarity], result of:
        0.1082226 = score(doc=974,freq=2.0), product of:
          0.23337814 = queryWeight, product of:
            2.1670933 = boost
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.020526731 = queryNorm
          0.46372208 = fieldWeight in 974, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.0625 = fieldNorm(doc=974)
      0.18148163 = weight(abstract_txt:viel in 974) [ClassicSimilarity], result of:
        0.18148163 = score(doc=974,freq=2.0), product of:
          0.3294099 = queryWeight, product of:
            2.574636 = boost
            6.2330556 = idf(docFreq=235, maxDocs=44218)
            0.020526731 = queryNorm
          0.5509295 = fieldWeight in 974, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            6.2330556 = idf(docFreq=235, maxDocs=44218)
            0.0625 = fieldNorm(doc=974)
      0.15840283 = weight(abstract_txt:möglichst in 974) [ClassicSimilarity], result of:
        0.15840283 = score(doc=974,freq=1.0), product of:
          0.3790532 = queryWeight, product of:
            2.7618341 = boost
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.020526731 = queryNorm
          0.41789076 = fieldWeight in 974, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.0625 = fieldNorm(doc=974)
      0.23440582 = weight(abstract_txt:fördern in 974) [ClassicSimilarity], result of:
        0.23440582 = score(doc=974,freq=1.0), product of:
          0.49223268 = queryWeight, product of:
            3.147261 = boost
            7.61935 = idf(docFreq=58, maxDocs=44218)
            0.020526731 = queryNorm
          0.47620937 = fieldWeight in 974, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            7.61935 = idf(docFreq=58, maxDocs=44218)
            0.0625 = fieldNorm(doc=974)
    0.5 = coord(4/8)

vascoda.de : Neuer Weg zur wissenschaftlichen Information (2003) 0.29

0.2851379 = sum of:
  0.2851379 = product of:
    0.45622063 = sum of:
      0.00797529 = weight(abstract_txt:information in 1845) [ClassicSimilarity], result of:
        0.00797529 = score(doc=1845,freq=2.0), product of:
          0.049694117 = queryWeight, product of:
            2.4209464 = idf(docFreq=10677, maxDocs=44218)
            0.020526731 = queryNorm
          0.16048759 = fieldWeight in 1845, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            2.4209464 = idf(docFreq=10677, maxDocs=44218)
            0.046875 = fieldNorm(doc=1845)
      0.057393704 = weight(abstract_txt:soll in 1845) [ClassicSimilarity], result of:
        0.057393704 = score(doc=1845,freq=1.0), product of:
          0.23337814 = queryWeight, product of:
            2.1670933 = boost
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.020526731 = queryNorm
          0.24592578 = fieldWeight in 1845, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.046875 = fieldNorm(doc=1845)
      0.09624517 = weight(abstract_txt:viel in 1845) [ClassicSimilarity], result of:
        0.09624517 = score(doc=1845,freq=1.0), product of:
          0.3294099 = queryWeight, product of:
            2.574636 = boost
            6.2330556 = idf(docFreq=235, maxDocs=44218)
            0.020526731 = queryNorm
          0.2921745 = fieldWeight in 1845, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            6.2330556 = idf(docFreq=235, maxDocs=44218)
            0.046875 = fieldNorm(doc=1845)
      0.11880212 = weight(abstract_txt:möglichst in 1845) [ClassicSimilarity], result of:
        0.11880212 = score(doc=1845,freq=1.0), product of:
          0.3790532 = queryWeight, product of:
            2.7618341 = boost
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.020526731 = queryNorm
          0.31341806 = fieldWeight in 1845, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.046875 = fieldNorm(doc=1845)
      0.17580436 = weight(abstract_txt:fördern in 1845) [ClassicSimilarity], result of:
        0.17580436 = score(doc=1845,freq=1.0), product of:
          0.49223268 = queryWeight, product of:
            3.147261 = boost
            7.61935 = idf(docFreq=58, maxDocs=44218)
            0.020526731 = queryNorm
          0.35715702 = fieldWeight in 1845, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            7.61935 = idf(docFreq=58, maxDocs=44218)
            0.046875 = fieldNorm(doc=1845)
    0.625 = coord(5/8)

Bargmann, M.; Katzmayr, M.; Putz, M.: E-LIS: Open-Access-Archiv für Literatur zum Informations- und Bibliothekswesen (2005) 0.21

0.2119643 = sum of:
  0.2119643 = product of:
    0.4239286 = sum of:
      0.0075191744 = weight(abstract_txt:information in 3779) [ClassicSimilarity], result of:
        0.0075191744 = score(doc=3779,freq=1.0), product of:
          0.049694117 = queryWeight, product of:
            2.4209464 = idf(docFreq=10677, maxDocs=44218)
            0.020526731 = queryNorm
          0.15130915 = fieldWeight in 3779, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            2.4209464 = idf(docFreq=10677, maxDocs=44218)
            0.0625 = fieldNorm(doc=3779)
      0.076524936 = weight(abstract_txt:soll in 3779) [ClassicSimilarity], result of:
        0.076524936 = score(doc=3779,freq=1.0), product of:
          0.23337814 = queryWeight, product of:
            2.1670933 = boost
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.020526731 = queryNorm
          0.32790104 = fieldWeight in 3779, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.0625 = fieldNorm(doc=3779)
      0.18148163 = weight(abstract_txt:viel in 3779) [ClassicSimilarity], result of:
        0.18148163 = score(doc=3779,freq=2.0), product of:
          0.3294099 = queryWeight, product of:
            2.574636 = boost
            6.2330556 = idf(docFreq=235, maxDocs=44218)
            0.020526731 = queryNorm
          0.5509295 = fieldWeight in 3779, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            6.2330556 = idf(docFreq=235, maxDocs=44218)
            0.0625 = fieldNorm(doc=3779)
      0.15840283 = weight(abstract_txt:möglichst in 3779) [ClassicSimilarity], result of:
        0.15840283 = score(doc=3779,freq=1.0), product of:
          0.3790532 = queryWeight, product of:
            2.7618341 = boost
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.020526731 = queryNorm
          0.41789076 = fieldWeight in 3779, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.0625 = fieldNorm(doc=3779)
    0.5 = coord(4/8)

Schmitz-Esser, W.: ¬Ein Thesaurus als Teil eines terminologischen Lexikons (1995) 0.21

0.20560844 = sum of:
  0.20560844 = product of:
    0.5482892 = sum of:
      0.015038349 = weight(abstract_txt:information in 2075) [ClassicSimilarity], result of:
        0.015038349 = score(doc=2075,freq=1.0), product of:
          0.049694117 = queryWeight, product of:
            2.4209464 = idf(docFreq=10677, maxDocs=44218)
            0.020526731 = queryNorm
          0.3026183 = fieldWeight in 2075, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            2.4209464 = idf(docFreq=10677, maxDocs=44218)
            0.125 = fieldNorm(doc=2075)
      0.2164452 = weight(abstract_txt:soll in 2075) [ClassicSimilarity], result of:
        0.2164452 = score(doc=2075,freq=2.0), product of:
          0.23337814 = queryWeight, product of:
            2.1670933 = boost
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.020526731 = queryNorm
          0.92744416 = fieldWeight in 2075, product of:
            1.4142135 = tf(freq=2.0), with freq of:
              2.0 = termFreq=2.0
            5.2464166 = idf(docFreq=632, maxDocs=44218)
            0.125 = fieldNorm(doc=2075)
      0.31680566 = weight(abstract_txt:möglichst in 2075) [ClassicSimilarity], result of:
        0.31680566 = score(doc=2075,freq=1.0), product of:
          0.3790532 = queryWeight, product of:
            2.7618341 = boost
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.020526731 = queryNorm
          0.8357815 = fieldWeight in 2075, product of:
            1.0 = tf(freq=1.0), with freq of:
              1.0 = termFreq=1.0
            6.686252 = idf(docFreq=149, maxDocs=44218)
            0.125 = fieldNorm(doc=2075)
    0.375 = coord(3/8)