Professional Documents
Culture Documents
Richard Weber1
Departamento de Ingeniera Industrial,
Universidad de Chile
Resumen
El desarrollo de software y hardware computacional ha resultado en la generacin
de enormes cantidades de datos almacenados en muchas empresas y organizaciones.
Estos datos contienen informacin valiosa, que puede ser usada para mejorar la
competitividad de estas instituciones. Data mining (minera de datos) se ha
convertido en un rea de investigacin y desarrollo, en el cual se estn proponiendo
tcnicas que apuntan a encontrar la informacin oculta en los datos. Este trabajo
presenta aplicaciones de tcnicas de data mining que han sido realizadas por un
departamento de marketing en una institucin bancaria.
1. Introduccin
El marketing juega un papel crucial en la mayora de las empresas, tanto en las
reas de negocios y finanzas, como de comercio, servicios y telecomunicaciones. Entre
las metas respectivas se incluyen las de encontrar nuevos clientes y mantener los
actuales reconociendo y satisfaciendo sus necesidades. Hoy en da el desarrollo de
software y hardware computacional permite a las empresas recoger y almacenar
enormes cantidades de datos descriptivos de sus clientes y su comportamiento. El rea
de investigacin y aplicacin en la que se desarrolla estrategias de marketing fundadas
en tales bases de datos se llama database marketing (Furness 1994; Nash 1993).
61
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
Data mining entrega diversas tcnicas para encontrar patrones en grandes conjuntos
de datos. Este enfoque multidisciplinario combina los resultados e intuiciones
provenientes de varias ramas cientficas tales como la estadstica, el aprendizaje
de mquina (machine learning), tecnologas difusas (fuzzy technologies), y redes
neuronales (vase por ejemplo, Adriaans y Zantinge 1996).
62
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
Este trabajo presenta una aplicacin del proceso de KDD para un banco donde,
en el paso 5, han sido elegidas las tareas de segmentacin de clientes y anlisis de
respuesta. El propsito de la segmentacin de clientes es la agrupacin (clustering)
de los clientes, mientras que el anlisis de respuesta apunta al modelaje de la
dependencia existente entre las medidas de marketing y el comportamiento de
respuesta posterior. En la aplicacin considerada en el presente trabajo, se ha
realizado la segmentacin de clientes utilizando la llamada agrupacin difusa (fuzzy
clustering), haciendo uso adems de tcnicas de redes neuronales y seleccin
automtica de atributos, para aumentar las tasas de respuesta.
La idea bsica de la teora de conjuntos difusos (fuzzy set theory) es que a diferencia
de la teora clsica de conjuntos un elemento puede ser miembro de un conjunto
con un grado de pertenencia que normalmente es un nmero entre 0 y 1 (Zadeh
1965). La nocin de un conjunto difuso se define de la siguiente manera:
A~ := f(x; A~(x)) ; x 2 X g
63
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
Paso 1: Inicializacin
Sea ((0) una matriz (c x J) con el elemento ij en posicin (i,j), i = 1, ..., c; j = 1, ...J.
Esta matriz se inicializa en forma aleatoria con la siguiente restriccin:
XC ij = 1 ; 8 j = 1; : : : ; J
i=1
Dados los valores de pertenencia ij, los centros vi de cada clase i estn dados por:
PJ ( )mx
ij j
vi = Pj=1
J ( )m ; 8 i = 1; : : : ; C
j =1 ij
64
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
0 0 1 2 1 1
B X c
@ dij A m 1 C 8 i = 1; : : : ; c
ij = @ A
k =1 dkj 8 j = 1; : : : ; J
Los pasos 2 y 3 se repiten en forma iterativa hasta cumplir con el siguiente criterio
de detencin:
(t+1)
(t)
(t )
donde es la matriz de los valores de pertenencia en la iteracin t y es un
umbral a ser determinado por el usuario. Las siguientes dos condiciones deben
cumplirse para asegurar la convergencia del algoritmo fuzzy c-means:
XC ij = 1 ; 8 j = 1; : : : ; J
i=1
ij 2 [0; 1] ; i = 1; : : : ; c; j = 1; : : : ; J
65
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
cp =
XJ XC (ij )2
j =1 i=1 J
ep =
X X ij loge ij
1 J C
J j =1 i=1
1
El valor mk se define como el entero ms grande que sea menor o igual a ,
donde k
k := max fik ; i = 1; : : : ; cg
1
c
cp 1 0 ep loge c 0 exp 1
66
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
El trmino red neuronal (NN, por Neural Network) se usa para denotar modelos
matemticos de las funciones del cerebro humano, que pretenden expresar las
propiedades del procesamiento paralelo masivo y de la representacin distribuida
existente en el cerebro. Las redes neuronales artificiales aprenden a partir de la
experiencia, y es esta caracterstica la que ha suscitado el inters actual en estos
mtodos. El aprendizaje ofrece una poderosa alternativa a la programacin. Se
han propuesto diferentes estrategias de aprendizaje para redes neuronales tales
como el aprendizaje supervisado y no-supervisado (Rojas 1996).
ik
new
= ik
old
+ rij ek
old
ik i; j = 1; : : : ; N; k = 1; : : : ; M
67
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
6. Volver al paso 2.
donde,
: tasa de aprendizaje
donde
: radio de aprendizaje
68
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
69
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
70
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
Por otra parte, la normalizacin hace que los datos sean comparables, ya
que originalmente los datos pueden tener diferentes dimensiones y diferentes
rangos de escala, llevando (sin la normalizacin) a diferentes ponderaciones de
atributos en el proceso de agrupacin.
71
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
72
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
de clientes pueden ofrecer pistas precoces del movimiento de un cliente entre las
clases y, como consecuencia, para actividades de marketing apropiadas.
WHERE Edad < 25 AND Trabajo = Empleado AND Monto de crdito < 5.000
73
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
Por esta razn, se decidi establecer la relacin entre el perfil del cliente
por un lado y su tendencia a comprar un producto por otro lado usando una red
neuronal, ya que sta tiene la capacidad de representar el tipo de relacin no-
lineal y no-homognea requerida. Sin embargo, a fin de usar slo los atributos
ms importantes, el siguiente paso del procedimiento de anlisis consisti en
reducir el espacio de atributos considerados. Esto tambin debera entregar una
indicacin de los atributos que realmente son relevantes.
74
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
Resultados
Los resultados fueron comparados con los resultados reales del mailing,
calculndose las tasas de respuesta correspondientes. Estas se presentan en el
siguiente cuadro.
2 20.0% 350
3 18.3% 460
4 17.4% 530
5 17.6% 500
75
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
76
R EVISTA I NGENIERA DE S ISTEMAS V OLUMEN XIV, N 1, J UNIO 2000
6. Referencias bibliogrficas
77
R. WEBER DATA MINING EN LA EMPRESA Y EN LAS FINANZAS UTILIZANDO TECNOLOGAS INTELIGENTES
Weber, R. (1996): Customer Segmentation for Banks and Insurance Groups with Fuzzy
Clustering Techniques. En: J. F. Baldwin (ed.): Fuzzy Logic, John Wiley and Sons,
Chichester, 187 196.
Weber, R. (1999): Dynamic Data Mining with Functional Fuzzy Clustering. Actas de
Resumenes Extendidos, III Congreso Chileno de Investigacin Operativa OPTIMA
99, Arica, Chile, 13-15 de octubre de 1999, 217-224
Windham, M. P. (1981): Cluster Validity for Fuzzy Clustering Algorithms. Fuzzy Sets and
Systems 5, 177-185.
Zadeh, L. A. (1965): Fuzzy Sets. Information and Control 8, 338-353.
Zimmermann, H.-J. (1996): Fuzzy Set Theory - and Its Applications. 3er edicin. Kluwer
Academic Publishers, Boston Dordrecht, Londres.
78