Unidad 2 Base de datos para la toma de decisiones
2.1 Almacenes de Datos (Data Warehouse)
Un Almacén de Datos (o Data Warehouse) es una gran colección de datos que recoge información de múltiples sistemas fuentes u operacionales dispersos, y cuya actividad se centra en la “Toma de Decisiones”.
Una vez reunidos los datos de los sistemas fuentes se guardan durante mucho tiempo, lo que permite el acceso a datos históricos; asílos Almacenes de Datos proporcionan al usuario una interfaz consolidada única para los datos, lo que hace más fácil escribir las consultas para la Toma de Decisiones.
2.1.1 Características
Organizado en torno a temas.La información se clasifica en base a los aspectos que son de interés para la empresa.
Integrado.Es el aspecto más importante. La integración de datos consiste en convenciones de nombres, codificaciones consistentes, medida uniforme de variables, etc.
Dependiente del tiempo.Esta dependencia aparece de tres formas:
–La información representa los datos sobre un horizonte largo de tiempo.
–Cada estructura clave contiene (implícita o explícitamente) un elemento de tiempo (día, semana, mes, etc.).
–La información, una vez registrada correctamente, no puede ser actualizada.
No volátil.El Almacén de Datos sólo permite cargar nuevos datos y acceder a los ya almacenados, pero no permite ni borrar ni modificar losdatos.
2.1.2 Arquitectura
Arquitectura de un DW –Repositorio de Datos
El repositorio de datos operacionales es la fuente donde se encuentran los datos primitivos, actuales e integrados, por lo tanto es el encargado de suministrar datos al sistema, estos datos operacionales pueden ser:
Mayoritariamente precedentes de sistemas mainframe.
Datos de estaciones de trabajo o servidores privados.
Sistemas externos como las bases de datos comerciales, de proveedores o clientes, o incluso de Internet.
Datos departamentales almacenados en Sistemas Propietario.
Arquitectura de un DW –Gestor de Carga
También conocido comoSistema ETL (Extraction, Transformation, Load), es el encargado de realizar las funciones de extracciónde las fuentes de datos (transaccionales o externas), transformación(limpieza, consolidación principalmente) y la cargadel Almacén de Datos, también hace el refresco del almacén (operación periódica que propaga los cambios de las fuentes externas al almacén de datos).
Arquitectura de un DW –Gestor del Almacén de Datos
Realiza las operaciones relacionadas con la gestión de los datos dentro del Almacén utilizando herramientas específicas que realizan operaciones como la transformación de datos para la incorporación de éstos en las tablas del Almacén de Datos, la creación de índices y vistas de las tablas base, creación de copias de seguridad y archivado de datos, además del análisis de los datos para garantizar la coherencia de los mismos.
Arquitectura de un DW –Tipos de Datos (1)
Datos Detallados. Son los que se obtienen directamente del procesado de los datos, no se encuentran almacenados en línea, sino que se puede acceder a ellos con un nivel más bajo de detalle. Se almacenan en disco ocupando mucho espacio, sin embargo asíse facilita el acceso.
2.1.3 Diseño
1.-Origen (Source): Define los orígenes de datos del Almacén de Datos, como los sistemas de Procesamiento de Transacciones en Línea (On-LineTransactionProcessing, OLTP), las fuentes de datos externas (datos sindicados, datos censales), etc.
2.-Integración (Integration): Define el mapeo entre los orígenes de datos y el propio Almacén de Datos.
3.-Almacén de Datos (Data Warehouse):Define la estructura del Almacén de Datos.
4.-Adaptación (Customization): Define el mapeo entre el Almacén de Datos y las estructuras empleadas por el cliente.
5.-Cliente (Client): Define las estructuras concretas que son empleadas por los clientes para acceder al Almacén de Datos, como Data Martso aplicaciones OLAP.
Niveles por Etapa del Diseño del Almacén de Datos
Cada etapa se analiza desde tres niveles o perspectivas que se crean en el siguiente orden:
Conceptual:Define el Almacén de Datos desde un punto de vista conceptual, es decir, desde el mayor nivel de abstracción y contiene únicamente los objetos y relaciones más importantes.
Lógico:Abarca aspectos lógicos del diseño del Almacén de Datos, como la definición de las tablas y claves, la definición de los procesos ETL, etc.
Físico:Define los aspectos físicos del Almacén de Datos, como el almacenamiento de las estructuras lógicas en diferentes discos o la configuración de los servidores de bases de datos que mantienen el almacén de datos.
2.2 Minería de datos (Data Mining)
La minería de datos (DM, Data Mining) consiste en la extracción no trivial de información que reside de manera implícita en los datos. Dicha información era previamente desconocida y podrá resultar útil para algún proceso. En otras palabras, la minería de datos prepara, sondea y explora los datos para sacar la información oculta en ellos.
Bajo el nombre de minería de datos se engloba todo un conjunto de técnicas encaminadas a la extracción de conocimiento procesable, implícito en las bases de datos. Está fuertemente ligado con la supervisión de procesos industriales ya que resulta muy útil para aprovechar los datos almacenados en las bases de datos.
Las bases de la minería de datos se encuentran en la inteligencia artificial y en el análisis estadístico. Mediante los modelos extraídos utilizando técnicas de minería de datos se aborda la solución a problemas de predicción, clasificación y segmentación.
2.2.1 Antecedentes
La minería de datos, entendida como la búsqueda de patrones dentro de grandes bases de datos utilizando para ello métodos estadísticos y de aprendizaje basado en computadora, está empezando a extenderse en nuestro país. Empresas en el sector de telecomunicaciones, financiero y de autoservicio están en el proceso de adquirir alguna solución tecnológica en este campo, por lo que surge una demanda por recursos humanos con conocimientos en minería de datos.
Además, al enfrentar un ambiente más competitivo las empresas requieren de tecnologías que les permitan pronosticar, dentro de un marco probabilística, el comportamiento de sus clientes y prospectos a fin de desarrollar estrategias de atracción o retención.
Aunque desde un punto de vista académico el término data mining es una
etapa dentro de un proceso mayor llamado extracción de conocimiento en bases de datos, (mencionado en el capitulo anterior) en el entorno comercial, así como en este trabajo, ambos términos se usan de manera indistinta. Lo que en verdad hace el data mining es reunir las ventajas de varias áreas como la Estadística, la Inteligencia Artificial, la Computación Gráfica, las Bases de Datos y el Procesamiento Masivo, principalmente usando como materia prima
las bases de datos. Una definición tradicional es la siguiente: Un proceso no
trivial de identificación válida, novedosa, potencialmente útil y entendible de
patrones comprensibles que se encuentran ocultos en los datos (Fayyad y otros,
1996). Desde el punto de vista empresarial , lo definimos como: La integración
de un conjunto de áreas que tienen como propósito la identificación de un
conocimiento obtenido a partir de las bases de datos que aporten un sesgo
hacia la toma de decisión (Molina y otros, 2001).
La idea de data mining no es nueva. Ya desde los años sesenta los estadísticos manejaban términos como data fishing, data mining o data archaeology con la idea de encontrar correlaciones sin una hipótesis previa en bases de datos con ruido. A principios de los años ochenta, Rakesh Agrawal, Gio Wiederhold, Robert Blum y Gregory Piatetsky-Shapiro, entre otros, empezaron a consolidar los términos de data mining y KDD.[3] A finales de los años ochenta sólo existían un par de empresas dedicadas a esta tecnología; en 2002 existen más de 100 empresas en el mundo que ofrecen alrededor de 300 soluciones.
Las listas de discusión sobre este tema las forman investigadores de más de ochenta países. Esta tecnología ha sido un buen punto de encuentro entre personas pertenecientes al ámbito académico y al de los negocios.
El data mining es una tecnología compuesta por etapas que integra varias áreas y que no se debe confundir con un gran software. Durante el desarrollo de un proyecto de este tipo se usan diferentes aplicaciones software en cada
etapa que pueden ser estadísticas, de visualización de datos o de inteligencia artificial, principalmente. Actualmente existen aplicaciones o herramientas comerciales de data mining muy poderosas que contienen un sinfín de utilerías
que facilitan el desarrollo de un proyecto. Sin embargo, casi siempre acaban complementándose con otra herramienta.
La data mining es la etapa de descubrimiento en el proceso de KDD: Paso
consistente en el uso de algoritmos concretos que generan una enumeración
de patrones a partir de los datos preprocesados (Fayyad et al., 1996)Aunque
se suelen usar indistintamente los términos KDD y Minería de Datos.
Los Fundamentos del Data Mining
Las técnicas de Data Mining son el resultado de un largo proceso de investigación
y desarrollo de productos. Esta evolución comenzó cuando los datos
de negocios fueron almacenados por primera vez en computadoras, y continuó
con mejoras en el acceso a los datos, y más recientemente con tecnologías generadas
para permitir a los usuarios navegar a través de los datos en tiempo
real. Data Mining toma este proceso de evolución más allá del acceso y navegación
retrospectiva de los datos, hacia la entrega de información prospectiva
y proactiva. Data Mining está listo para su aplicación en la comunidad de negocios
porque está soportado por tres tecnologías que ya están suficientemente
maduras:
• Recolección masiva de datos.
• Potentes computadoras con multiprocesadores.
• Algoritmos de Data Mining.
2.2.2 Fases de proyectos de minería de datos
Un proyecto de minería de datos tiene varias fases necesarias que son, esencialmente:
• Comprensión del negocio y del problema que se quiere resolver.
• Determinación, obtención y limpieza de los datos necesarios.
• Creación de modelos matemáticos.
• Validación, comunicación, etc. de los resultados obtenidos.
• Integración, si procede, de los resultados en un sistema transaccional o similar.
La relación entre todas estas fases sólo es lineal sobre el papel. En realidad, es mucho más compleja y esconde toda una jerarquía de subfases. A través de la experiencia acumulada en proyectos de minería de datos se han ido desarrollando metodologías que permiten gestionar esta complejidad de una manera más o menos uniforme. Ejemplo de ella es CRISP-DM, se cree que SEMMA es una metodología SAS declara en su página que ésta NO es una metodología
2.2.3 Filtrado de datos
El formato de los datos contenidos en la fuente de datos nunca es el idóneo y la mayoría de las veces no es posible utilizar ningún algoritmo de minería. Mediante el preprocesado, se filtran los datos (se eliminan valores incorrectos, no válidos, desconocidos... ), se obtienen muestras de los mismos (mayor velocidad de respuesta del proceso), o se reduce el número de valores posibles (mediante redondeo, clustering,...).
2.2.4 Selección de Variables
Aún después de haber sido preprocesados, se sigue teniendo una cantidad ingente de datos. La selección de características reduce el tamaño de los datos, eligiendo las variables más influyentes en el problema, sin apenas sacrificar la calidad del modelo de conocimiento obtenido del proceso de minería. Los métodos para la selección de características son dos: - Los basados en la elección de los mejores atributos del problema - Los que buscan variables independientes mediante tests de sensibilidad, algoritmos de distancia o heurísticos.
También existen dos tipos de algoritmos de Selección de Características, wrapper o de envoltura y filter o de filtro. Los primeros utilizan un algoritmo de aprendizaje, mientras que los segundos lo hacen de medidas estadísticas o funciones heurísticas.
2.2.5 Extracción de Conocimiento
Mediante una técnica se obtiene un modelo de conocimiento, que representa patrones de comportamiento observados en los valores de las variables del problema o relaciones de asociación entre dichas variables. También pueden usarse varias técnicas a la vez para generar distintos modelos
2.2.6 Interpretación y Evaluación
Finalmente se procede a su validación, comprobando que las conclusiones son válidas y satisfactorias. En el caso de haber obtenido varios modelos mediante el uso de distintas técnicas, se deben comparar los modelos en busca de aquel que se ajuste mejor al problema. Si ninguno de los modelos alcanza los resultados esperados, se alterará alguno de los procesos anteriores en busca de nuevos modelos.
2.3Minería Web
La minería de datos es la tecnología que nos permite descubrir información oculta en los datos de cualquier sistema. En este sentido, cualquier servidor web registra un volumen de datos nada despreciable, anotando todas las peticiones que se le hacen desde el exterior. La minería de uso de la Web tiene por objeto extraer información y conocimiento útil de estos ficheros históricos de logs.
El proceso general de minería de uso de la Web parte del establecimiento de los
objetivos del gestor o propietario del servidor de información, pasando por fases de filtrado y limpieza de datos, así como transformación y agregación de datos. En este punto del proceso se utilizan diferentes técnicas para analizar y descubrir patrones de comportamiento interesantes en los clientes o usuarios. La información obtenida será de gran utilidad para mejorar el rendimiento de los servidores web, tanto desde el punto de vista técnico como de negocio.
Este documento ofrece una perspectiva general de todo este proceso. Los lectores que no tengan un conocimiento previo de lo que es la minería de datos, encontrarán una introducción en la sección 2, que incluye la descripción de algunas aplicaciones en Internet.
La sección 3 presenta el proceso que se debe seguir en todo proyecto de minería de uso de la Web. Las aplicaciones y tecnologías utilizadas en este proceso se muestran en la sección 4.
No hay comentarios:
Publicar un comentario