Idi na sadržaj

Rudarenje podataka

S Wikipedije, slobodne enciklopedije

Rudarenje podataka jeste proces otkrivanja obrazaca u velikim skupovima podataka primjenom metoda iz mašinskog učenja, statistike i sistema baza podataka.[1] Kao interdisciplinarna oblast računarstva i statistike, usmjereno je na izdvajanje informacija iz podataka i njihovo pretvaranje u razumljivu strukturu pogodnu za dalju analizu ili odlučivanje.[2] U užem smislu smatra se analitičkim korakom u procesu otkrivanja znanja u bazama podataka (KDD), dok širi postupak uključuje izbor, pripremu, transformaciju, interpretaciju i provjeru rezultata.[2] Sam izraz ponekad je neprecizan jer cilj nije "iskopavanje" samih podataka, nego izdvajanje obrazaca, zavisnosti i znanja iz velikih količina već prikupljenih podataka.[3]

Metodi i proces

[uredi | uredi izvor]

Tipični zadaci obuhvataju klasterizaciju, otkrivanje anomalija, klasifikaciju, regresiju, učenje asocijacijskih pravila i otkrivanje sekvencijalnih obrazaca.[4] Dobijeni obrasci mogu služiti kao sažetak ulaznih podataka, osnova za prediktivnu analitiku ili dio sistema za podršku odlučivanju.[1] Za razliku od klasične analize podataka, koja često provjerava unaprijed postavljenu hipotezu, rudarenje podataka obično traži ranije nepoznate ili skrivene obrasce u velikim količinama podataka.[3] U praksi se često koristi metodologija CRISP-DM, koja razlikuje razumijevanje poslovnog problema, razumijevanje podataka, pripremu podataka, modeliranje, evaluaciju i implementaciju.[5]

Primjena i pitanja

[uredi | uredi izvor]

Primjene se javljaju u poslovnoj inteligenciji, marketingu, medicini, bioinformatici, računarskoj sigurnosti, preporučivačkim sistemima i naučnom istraživanju. Veliki obim podataka, automatizirana obrada i mogućnost povezivanja više izvora otvaraju pitanja privatnosti, etike podataka, pristranosti modela, ponovljivosti i tumačenja rezultata.[6]

Reference

[uredi | uredi izvor]
  1. 1 2 Han, Jiawei; Kamber, Micheline; Pei, Jian (2012). Data Mining: Concepts and Techniques (3 izd.). Morgan Kaufmann. ISBN 978-0-12-381479-1.
  2. 1 2 Fayyad, Usama; Piatetsky-Shapiro, Gregory; Smyth, Padhraic (1996). "From Data Mining to Knowledge Discovery in Databases". AI Magazine. 17 (3): 37–54. doi:10.1609/aimag.v17i3.1230.
  3. 1 2 Hand, David J.; Mannila, Heikki; Smyth, Padhraic (2001). Principles of Data Mining. MIT Press. ISBN 978-0-262-08290-7.
  4. Witten, Ian H.; Frank, Eibe; Hall, Mark A. (2011). Data Mining: Practical Machine Learning Tools and Techniques (3 izd.). Elsevier. ISBN 978-0-12-374856-0.
  5. Shearer, Colin (2000). "The CRISP-DM Model: The New Blueprint for Data Mining". Journal of Data Warehousing. 5 (4): 13–22.
  6. Kshetri, Nir (2014). "Big data's impact on privacy, security and consumer welfare". Telecommunications Policy. 38 (11): 1134–1145. doi:10.1016/j.telpol.2014.10.002.

Dalje čitanje

[uredi | uredi izvor]