Nube de Etiquetas
(Ah?)

lunes, febrero 11, 2008

¿Regresión usando Programación Lineal?

Alfredo me comentaba que había leído varios tópicos de Investigación de Operaciones, pero que ninguno de los tópicos era Data-Mining, por ejemplo, o métodos Multi-Superficie. En mi respuesta le insinué que ciertamente no son tópicos de la IO, pero no por ello es imposible que si se idea una formulación adecuada del modelo, la IO pueda aportar en campos que en principio se asumen como "diferentes".

En un post anterior escribí sobre la diferencia entre Regresión y Clasificación. Para la mayoría de los que han tenido contacto con cursos introductorios de IO, estará claro que no son parte del temario de IO.

Todo esto me inclinó a escribir hoy acerca de una aplicación de IO para Regresión. Ya a muchos les quedó claro que me he ocupado bastante del uso de la IO para clasificar, y bueno, la Regresión quedó huerfanita, al parecer... ;o)

Antes que todo, quiero dejar claro que el modelo más famoso en la actualidad, para realizar clasificación binaria (los SVM) también es utilizado para regresión. Con esto quiero decir, que lo que voy a desarrollar acá no es la invención de la rueda.
Es un simple ejemplo ilustrativo, que me permitirá (espero yo!) mostrar una regresión mediate IO, sin entrar en detalles sobre los SVMs (vale la pena acotar que fue parte de los ejercicios de un curso de Análisis de Sistemas Lineales del Prof. Ubaldo García Palomares de la USB).

El ejemplo es el siguiente:

Se tienen 4 puntos en el plano cartesiano...
e1 = (0.1 , 1.0)
e2 = (0.8 , 2.2)
e3 = (2.2 , 2.8)
e4 = (3.3 , 3.9)

Que lucen más o menos así, al graficarlos en Excel (disculpen la cuña!):


Bueno. Se nos pide que, sin usar mínimos cuadrados, aproximemos una recta

y = a*x + b

que pase lo más cerca posible a todos esos puntos.

Yo voy a resolver el problema formulando un modelo de programación lineal... primero, tengo como información que la función a aproximar es una línea recta. Si me disculpan una notación extremadamente simple, diré que cuando tenga un i-ésimo punto ei, con componentes (xi , yi), tendré un error dado por la resta

[ yi - yi~ ]

donde yi~ es el estimado que me arroja la función de la recta, es decir:

yi~ = a*xi + b.

En mínimos cuadrados, se quiere hacer pequeña la suma de los errores cuadráticos:

[ yi - yi~ ]^2

Bueno, como me pidieron que no fuese una minimización de los errores cuadráticos, me quedaré con la expresión [ yi - yi~ ].

Ahora, ese error me va a dar positivo cuando el estimado sea menor que el valor real, y negativo cuando pase lo contrario... y si sumo los errores así, podrían cancelarse positivos con negativos, dando una suma que realmente no significará nada para mi.

Así que voy a hacer pequeña, en cambio, a la suma de los errores absolutos:

| yi - yi~ |

Ahora, recordemos de bachillerato que la función "valor absoluto" ( y=|x| ) no es lineal, así que... evidentemente no puedo resolverlo con Programación Lineal....

... O SI!!!

Yo puedo respirar profundo, abrir y cerrar los ojos, y escribir lo mismo, de forma un poquito diferente. Puedo tranquilamente decir que yi~ es igual a yi, más una variable "di" que mide el i-ésimo error de forma no-absoluta, así:

di = yi - yi~

yi~ + di = yi

Ahora, todavía la suma de los errores "di" me deja en las mismas, porque podría tener positivos y negativos (con toda seguridad!). No he hecho nada interesante aún. Sin embargo, ahora si respiro profundo y me aseguro de que mi lapiz tiene punta, porque voy a jugar con ese error "di". Quiero jugar de forma que tenga sólo variables no-negativas, que crezcan cuando hay error. Por ello, voy hacer lo primero que se me ocurre: expresarlo como una resta de dos valores positivos.

NOTA: cualquier número puede expresarse como
la diferencia
de dos valores no-negativos. Ejemplo:
1 = 34-33
-8 = 10 - 18

Por lo tanto, "nadie me quita lo bailao" si yo decido escribir ahora la diferencia así:

yi~ + (dip - din) = yi

donde dip, vale di, si el error es positivo... (y din = 0)
y din, vale -di, si éste es negativo... (y dip = 0)

Digamos, para mostrarlo fácilmente, que si yi = 2, y el estimado yi~ = 3, entonces tendremos:
3 + 0 - 1 = 2

en otras palabras, dip = 0, y din = 1.

Por lo que din estaría sumando 1 a mi total de errores, en lugar de un -1 (aunque el error que he definido es negativo, porque el verdadero valor es más pequeño que el estimado).

Ahora tengo lo siguiente, si lo aplicamos a los 4 puntos:

y1~ + d1p - d1n = y1
y2~ + d2p - d2n = y2
y3~ + d3p - d3n = y3
y4~ + d4p - d4n = y4

con d1p, d2p, d3p, d4p, d1n, d2n, d3n, d4n todos >= 0.

Esas serían las restricciones de mi modelo, que si sustituímos los estimados por la expresión que proporciona el estimado en base a el xi (componente x del i-ésimo punto) en cada caso, sería lo mismo que:

(a*x1 + b) + d1p - d1n = y1
(a*x2 + b) + d2p - d2n = y2
(a*x3 + b) + d3p - d3n = y3
(a*x4 + b) + d4p - d4n = y4
d1p, d2p, d3p, d4p, d1n, d2n, d3n, d4n >= 0

Nótese que he colocado las variables en color azul. Lo que esté en negro es "dato".

Ahora, me podría asustar y gritar: ¡ahora tengo 2 veces más incógnitas que antes! ... pero en este tipo de cosas lo que se nos pide es que tengamos la valentía de seguir adelante a ver a donde se llega, hasta que se llegue,... a la solución...

...o a una calle ciega... lo cual es siempre una posibilidad que no tiene por qué desanimarnos si no estamos en un exámen.. jeje.

Así que tomamos un poco de chocolate caliente para el alma, y nos preguntamos: ¿qué es lo que quiero hacer pequeño? Respuesta: la suma de los errores dip y din.

Es decir, que mi función objetivo es la suma de los errores positivos y negativos:

Minimizar Z = (d1p + d2p + d3p + d4p) + (d1n + d2n + d3n + d4n)

Esto hará, que en la resolución el algoritmo utilizado quiera hacer que todas las variables dip y din tengan el menor valor posible: cero (0), colocando la recta justo para que pase por los puntos.... en tus sueños!! jaja...

Como lo más probable es que no lo logre, tendrá que sacrificar alguna de las variables dejándola que sea mayor que cero. Pero en ningún momento hará que una que no sea necesaria, sea mayor que cero. El modelo entonces queda formulado completo así:

Minimizar Z = (d1p + d2p + d3p + d4p) + (d1n + d2n + d3n + d4n)
din, dip, a, b

Sujeto a:
(a*x1 + b) + d1p - d1n = y1
(a*x2 + b) + d2p - d2n = y2

(a*x3 + b) + d3p - d3n = y3

(a*x4 + b) + d4p - d4n = y4
d1p, d2p, d3p, d4p, d1n, d2n, d3n, d4n >= 0

Abajo tengo una imágen donde muestro en excel como saqué las cuentas en la hoja de cálculo, para la función objetivo y los valores que necesito para las restricciones. Lo amarillo es celda que representa a una variable, y lo azul son celdas que cambian en función de las variables (diferente a como coloreé las cosas en el texto). Guardé ese pantallazo mostrando en particular la fórmula con que estoy calculando el y~.


Ya es el momento de llamar a la máquina que me dirá cuáles son los valores óptimos de "a" y "b" de la recta, es decir, aquellos que podrán existir haciendo la suma de los errores lo más pequeña posible. La forma en que llené los datos en el Solver, la muestro abajo. Dense cuenta de que hice que los dip y din fuesen no-negativos, pero no restringí en absoluto a las variables "a" y "b":

(Las dudas sobre lo que significa lo que se ve arriba las podemos aclarar luego en la medida en que me pregunten, si lo desean)

Finalmente, y para no seguir alargando el post, veamos el resultado que arroja el Solver, así como una graficación de la recta que resulta:


¿No está mal, eh? Bueno. Aquí termina el ejemplo de hoy.

Traté de hacer esto de forma que todos pudiesen replicar el resultado fácilmente. Espero haberlo logrado. ¡Cualquier cosa, como siempre: pregunten!

Así pues, tenemos una regresión, no basada en minimización de errores cuadrados, sino obtenida mediante la resolución de la clase de modelo más emblemático de la IO: la Programación Lineal.

¿Es la Regresión Lineal un problema de IO? Probablemente no... pero no significa que pueda usarla para resolver el problema. ¡Ese es el espíritu!

Nota: para los recién iniciados en esto, que estén curiosos y quieran ver más allá de lo evidente, les adelanto que este tipo de regresión tiene cierto tipo de ventajas respecto a la regresión cuadrática bajo ciertas circunstancias. Se llama minimización en "norma - 1", mientras que en la de mínimos cuadrados se minimiza la "norma - 2"....

...pero eso es parte de otra historia

XoD

sábado, febrero 09, 2008

Respuestas para Alfredo

Primero que todo, Alfredo, gracias por tomar la confianza de escribirme, me gusta ayudar (es una de las principales razones por las cuales escribo el blog... porque yo quisiera haber podido leer algo como esto cuando me iniciaba en el área). Como tus preguntas no son de las que uno quisiera responder con monosílabos, te respondo en un post.

Sabes? No se necesita ser una lumbrera para meterse en esto. Sólo se necesita hacer lo que estás haciendo: dedicarle... y algo que te ayudará a hacerlo, es tener gusto por esto. Al poco tiempo tendrás que explicarle a los demás que tu no eres una lumbrera (si ellos hubiesen pasado el mismo tiempo que tu, dedicándole a esto, no les parecería tan genial lo que tu puedes hacer con estas herramientas). Yo tampoco soy una lumbrera, by the way... jeje.

En cuanto a tus preguntas a mi "como analista de operaciones", tengo que decirte varias cosas:
No he tenido trabajo en la empresa privada como "analista de operaciones". Y con esto me refiero a que no he tenido un trabajo en el que haya podido utilizar la investigación de operaciones (hasta ahora).
  1. El trabajo de una persona que tiene experticia en investigación de operaciones puede ser (en el mundo empresarial/industrial) uno de planificación, por ejemplo, o el de consultor. El resto de los trabajos que he podido ver, puede que requieran puntualmente el uso de investigación de operaciones, pero una vez encontrado el modelo, e implementado, correrlo periódicamente no es un trabajo interesante para una persona con el perfil de IO.
  2. En el mundo académico, es obvio que el trabajo para una persona del área de IO es dar clases, y buscar ampliar los horizontes de la IO mediante la investigación, que además te pone en contacto con lo que otros locos están haciendo respecto a eso en otras partes del mundo.
  3. Recientemente un Gran Amigo de la infancia me propuso trabajar juntos como consultores. Mi actividad cotidiana en ese aspecto estaría formada por actividades de este tipo:
    • reunirme con el cliente para entender su problema
    • definir un modelo (esto es un proceso que es arte y ciencia)
    • definir cómo voy a recoger los datos que necesito y negociar con el cliente cómo vamos a recogerlos.
    • definir qué infraestructura informática necesito para resolver el modelo y negociarlo con el cliente.
    • intentar explicar al cliente en forma sencilla qué es lo que estoy haciendo.
    • fumarme una lumpia para resolver el modelo que planteé.
    • ver los resultados, y traducir eso en algo que pueda digerir el cliente.
    • antes que todo, demostrar al cliente qué beneficios le puede traer contratarte para que apliques IO
    • Eh... creo que esa es una lista que podría darte una idea de la no-cotidianidad del asunto.
  4. En cuanto a que si la IO es tan tomada en serio en Venezuela como lo podría ser en EEUU, te puedo decir, sin que me quede nada por dentro, que la respuesta es: NO. Lo más frecuente es que las respuestas en Venezuela las de alguien con experiencia (al menos aparente) o el viento que pegue en el dedo luego de ser correctamente ensalibado (yuck!). Esto no siempre es criticable, puesto que los "sistemas" que uno analiza en países como el nuestro no siempre son del todo estables, predecibles y bonitos, sino que la alta sensibilidad a miles de variables ... todas en comportamiento caótico... hacen que estas técnicas ameriten una gran inversión, o tengan poca probabilidad de ser efectivas. Eso no significa que haya puestos en las empresas del área de petróleo, comunicaciones, construcción, e industrias manufactureras y de producción "contínua" que denigren de estas técnicas. Simplemente que son pocos los sitios donde lo hacen. Tengo entendido que en "la anterior PDVSA" (dejémoslo así para no entrar en el tema político) había un departamento de gente de IO dedicada específicamente a mejorar los procesos e la empresa mediante estas técnicas. Hay empresas consultoras que valoran MUCHO que una persona tenga formación en IO, aunque no lo usen nunca en el puesto que le van a dar, tan sólo por "el tipo de pensamiento" que tenemos. Con esto termino en lo referente a las posibilidades de trabajo.
La pregunta sobre la "buena paga", no puedo respondértela con propiedad, porque tengo noticias de personas a las que les pagan bien poco, y otras que ganan una millonada. Los sueldos en PDVSA no estaban para nada mal, en "épocas anteriores", por ejemplo. Ahora, consultoras hay de muchas clases, unas que pagan mucho y luego, al finalizar un contrato te botan. Otras te pagan mucho menos, pero no te echan a la calle. Creo que lo importante es saber venderte.

No hay una "moda" como la que hay por la gente que tiene academia SAP, por ejemplo, que siempre son bien pagados, si es lo que querías saber. Espero esto te responda un poco tus inquietudes.

Me preguntas ¿Hacia donde se dirige la IO?... y me pones en problemas. La IO es un campo MUY amplio. No sólo en cuanto al tipo de técnicas que hay, sino a las aplicaciones, y al enfoque que tienen las personas. Por ejemplo, hay gente que se ocupa de la Programación Lineal, desde un punto de vista estrictamente matemático, generando nuevas aproximaciones a la resolución del problema. Otros se paran desde el punto de vista computacional, viendo como resuelven los obstáculos que pueden presentarse al sacar las cuentas con una computadora. Y hay otros, como yo, que nos ocupamos de usar el ingenio en resolver problemas nuevos con técnicas viejas, mediante innovación en la formulación. Aunque pensaba que esa era la última de mi enumeración, creo que también hay gente que se ocupa de mezclar las técnicas de IO con otras técnicas: estadística, lógica difusa, redes neurales, etc.

Cada uno de estos miembros de esta fauna de la IO, a su vez, tienen campos muy específicos en los que investigan, y todos los meses puedes ver en las revistas arbitradas que hay en el mundo, publicaciones de cosas nuevas. La pregunta, Alfredo, para respondértela más certeramente, tendrías que hacérmela restringida a un tipo de fauna de IO, y además restringida a un tipo de problema... vale? y disculpa esa!

Creo que es obvio que mi opinión es que hay MUCHO campo para investigar. No en vano hay revistas arbitradas dedicadas exclusivamente al área de IO.

Sin embargo quiero dejar en claro algo: los temas en los que se inicia el estudio de la IO son la Programación Lineal, la Teoría de Colas, el Pert-CPM, los modelos de Optmización en Redes, la Simulación de Eventos Discretos y la Programación Lineal Entera... eso es cierto...
Pero esos temas son las herramientas básicas.

Ahora, el Data-Mining, por ejemplo, no es en si mismo un tema típico de IO. Los modelos de IO que se han aplicado para hacer Data-Mining son eso mismo: algoritmos de un área, utilizados para resolver un problema de otra área (lo cual nos lleva a ver que las áreas están entrelazadas).

Por ejemplo, un problema de SVM (Support Vector Machine) ciertamente es un modelo de Programación Matemática (y por ende IO), pero no todo modelo de IO puede ser aplicado para el reconocimiento de patrones. Normalmente los modelos de Programación Matemática usualmente dan un resultado válido estrictamente para los parámetros que se utilizan al momento de resovlerlo,... y puedes mantener "la solución" sólo si cambian esos parámetros dentro de los rangos que de da el análisis de sensibilidad. Una vez cambian demasiado los parámetros, la solución es otra. Por lo tanto, en principio, no son buenos para "generalizar". En particular los modelos como el SVM y los utilizados en Métodos Multi-Superficie están construídos con la intención de obtener una buena capacidad de generalización, y los parámetros que reciben al formularlos, SON los elementos sobre los cuales se va a generalizar. Sólo por ello sirven para "simular" aprendizaje. ¡Así que OJO con eso Alfredo! Lo que si puedo permitirme decirte es que esto demuestra que la IO no tiene por qué restringirse a los temas y problemas clásicos.

La imaginación es el límite... dice el cliché por ahí... jeje... aunque yo también diría que ese límite a veces se hace más pequeño debido a las restricciones en capacidad de cómputo que tendremos siempre, obligándonos a simplificar nuestros modelos para poder tener una respuesta en un tiempo razonable.

¡Espero te sientas respondido!

Regresando a la Web

8 días sin internet... no fue algo que me enloqueciera, pero definitivamente la piquiña en los dedos (por escribir) y en los ojos (por leer) era innegable.
Eso si: nunca imaginé que este blog (con pocos posts, y de temática no muy "comercial") iba a tener la cantidad de visitas que tuvo, ni los comentarios que hoy veo que han dejado en este tiempo.
A quienes esperaban el próximo post, o una respuesta a los comentarios, les pido disculpas por hacerles esperar. Sin embargo, créanme: fue por una buena razón.
Mi papá, desde el 1º de Febrero lo ingresamos por emergencia a una clínica, y estuvo hospitalizado hasta ayer, y en esta ocasión el único que podía quedarse allí con él a cuidar de él, era yo. Pero ya todo volvió a la normalidad.
Bueno, dicho esto, no me queda otra cosa que darles las gracias por la recepitividad con que han acogido este blog... y por supuesto ponerme a responder los comentarios ASAP. :o)
Como le digo a mis compañeros de juegos de rol cuando falto a una sesión (virtual o no), "la realidad se me atravesó". Pero ya tengo licencia para seguir soñando despierto nuevamente, y compartirlo con Uds.
See you in the mirror!

viernes, febrero 01, 2008

Regresión vs. Clasificación

Regresión, en el contexto de la estadística y el modelaje matemático, es algo claramente distinto a autoespiarse en una etapa infantil o una vida pasada. Y ciertamente cuando uno hace una regresión típica (digamos, por ejemplo, mínimos cuadrados), uno ciertamente no siente que está regresando en ningún sentido.
El orígen del término data del siglo XIX, cuando fue utilizado en el contexto del análisis de un proceso biológico. Éste proceso tenía que ver con el hecho de que los descendientes de individuos excepcionales, tienden a ser más normalitos que sus excepcionales ancestros. Charles Darwin tenía un primo de apellido Galton (si no me equivoco) que llamó a este proceso "regresión". Este caso fue estudiado luego desde el punto de vista estadístico, y al final se terminó llamando "Regresión" a las técnicas en las que uno examina como se reacciona una variable de respuesta (variable dependiente) en función de una variable explicativa (variable independiente).
Este tipo de procesos de análisis no requieren entender los procesos detrás de la generación de los datos estudiados. Las premisas que se toman, en todo caso, son sólo de tipo estadístico (como por ejemplo que los errores respecto a la curva que "modela" el sistema están distribuídos según la campana de Gauss).
La regresión se usa para realizar pronósticos, probar hipótesis, estimar parámetros, entre otras cosas. He escuchado varias opiniones acerca de estos métodos, y no les quito razón, cuando dicen que debido a que "cualquiera hace una regresión, pero sólo expertos pueden criticarlas", uno encuentra que muchísima gente hace una regresión simplemente por hacerla.
Los que no conocen de estadística o modelos matemáticos ven unas "cuentas" y una curva, y realmente no tienen el tiempo de comprobar que todo lo que se hizo está bien, pero ya la exposición del analista de la regresión queda enmarcada en una supuesta formalidad.
A esto se refiere el dicho de que "la mayoría de las personas usan la estadística de la misma forma que los borrachos usan los postes de luz, para apoyarse, pero no para buscar iluminación".
Al final, simplemente una regresión es una forma de aproximar una expresión matemática para que se comporte de forma similar a un conjunto de datos que uno ha recogido. Por ejemplo: quiero saber cómo varía la presión atmosférica según se sube por una montaña, y hago mi escalada para la montaña, parándome 4 veces en mi camino para sacar mi barómetro y ver cuánto marca, y en el mapa me dicen a que altura está el parador turístico en el que me detuve a hacer la medición, por lo que en mis notas pongo los dos datos juntos.
Al final tengo 4 pares de datos (altitud, presión), y en la próxima tarde lluviosa me pongo a sacar cuentas, para ver qué función matemática pasa por esos puntos de la mejor forma. Cuando la tenga lista, asumiré que cada vez que me digan la altura, podré estimar la presión, y viceversa. Perfecto. Si no tuviese esa técnica (ni conocimientos teóricos sobre termodinámica y fluídos), sólo podría responder a esas preguntas específicamente para los puntos que ya medí. Ahora puedo responderlo para cualquier punto intermedio aunque no me haya parado a medir.
¿Y para donde voy con todo esto? Bien. Ahora que está claro para todos lo que es una regresión, puedo pasar a relacionar el concepto con el de clasificación, que lo hablé en un post anterior.
Resulta que construír un modelo de clasificación es conceptualmente muy similar a construír un modelo de regresión, sólo que la respuesta que se me pide que de, no es un número cualquiera, sino una categoría.
Es algo así como que me pidan que elabore un modelo para saber cuando un lugar es de presión alta y cuando es de presión baja. Me voy de paseo, y en el camino voy preguntando a las personas: "¡Señor! ¿acá la presión es alta o baja?". Voy anotando los valores de altitud, junto a la respuesta del paisano de ese lugar en mi cuadernito. Luego tengo que sentarme en mi casa y ver para cada altura qué me respondieron. El modelo podría ser algo así como "Si la altura es mayor que X, la gente en general piensa que la presión es alta". Ese es mi modelo de clasificación.
En el fondo es un modelo de Regresión, pero que la variable de respuesta (dependiente) no es contínua, sino categórica.
Bueno, a mi me pareció interesante cuando supe esto, y quería compartirlo con los que aún no han pasado a considerarlo trivial, jeje. Son los pequeños asombros que lo animan a uno a seguir investigando estas cosas. ¿No es verdad?

jueves, enero 31, 2008

Clasificar vs. Reconocer un Patrón

Estaba en estos días reunido con un amigo explicándole que estaba trabajando en un algoritmo para el reconocimiento de patrones binarios. Entré en detalles, y posteriormente usé la palabra "Clasificación binaria", lo que le motivó a preguntarme:
Por fin, Orestes ¿esto no era para reconocimiento de patrones? ¡Ahora me acabas de decir que es para clasificacion binaria!.

Claro... para algunos de ustedes, que también están empapados en estos temas, la pregunta es trivial. Sin embargo para los que ocupan su mente con otro tipo de problemas y herramientas, no es evidente que ambas cosas son lo mismo.
Para ellos estoy escribiendo este post, y lo haré parafraseando una explicación muy buena que hicieron K.P. Bennet y E.J. Bredensteiner en su artículo "Geometry in Learning".
Imagínese que su trabajo es determinar si un tumor de seno es benigno o maligno. Un cirujano inserta una aguja en el tumor y aspira una pequeña cantidad de tejido. Se prepara una placa de vidrio (porta-objeto) en la que se coloca la muestra, y usted procede a colocarla en el microscopio para estudiarla. Su trabajo es examinar las células que están en la láminilla de vidrio, reconocer los atributos importantes de las células, tales como la uniformidad de la fórma de las células, y la variabilidad en el tamaño. Eventualmente usted llega a la conclusión de que es benigno, o de que es maligno. Esto es algo que usted debería haber aprendido a hacer luego de examinar montones de tumores de los que ya previamente le habían chismeado si el tumor era maligno o benigno, de parte de un experto patólogo que usó biopsias quirúrjicas tradicionales (a punta de cuchillo, para ser completamente claros). Probablemente alguien podría ayudarle señalando en la imágen los atributos que deben ser estudiados con más incapié. Y entonces usted debería "generalizar" el conocimiento que aprendió, aplicándolo luego para estudiar nuevos tumores, para (por ejemplo) tener una idea previa de la malginidad del caso, sin tener que echar cuchillo al delicado seno (y aquí termina mi paráfrasis de la introducción del paper de Bennet y Bredensteiner).
Hablando normalmente, como quien se encuentra en una cafetería hablando con los familiares de la pacienet, usted diría sobre un caso, que "Reconoció el Patrón" que tienen los tumores malignos.
Ahora, hablando matemáticamente, podemos decir que usted "clasificó" a ese elemento como "Maligno", tal y como si usted tuviese una caja donde recibe los casos a estudiar, a su lado derecho, y dos cajas a su lado izquierdo, cada una con una etiqueta: una dice "Maligno" y otra dice "Benigno". El equivalente de su trabajo es tomar cada tumor de la caja de la derecha, estudiarlo, y en base al estudio de sus atributos, lo lanza a una de las cajas de la izquierda. Por eso es que los matemáticos consideran el proceso de "reconocer patrones", como un caso más de "clasificación".

Obviamente, esta puede ser de múltiples clases, no necesariamente binaria. Por ejemplo, reconocer caracteres visualmente, además de entenderse como "reconocer el patrón" de la letra A, la letra B, y así sucesivamente, puede entenderse como que usted tiene tantas cajitas a su izquierda, como letras hay en el abecedario (más una por cada número), y recibe un caracter, lo estudia y lo lanza en alguna de las cajitas luego de dar cuenta de los atibutos de ese caracter. Reconocer patrones de caracteres, es clasificar caracteres en tantos tipos como caracteres posibles pueda haber. También puede verse así el problema típico de "reconocer" una huella digital (alguno ha visto CSI?). Las "clases" son cada uno de los criminales en la base de datos contra la cuál se contrasta la huella en cuestión.

En fin... Yo ya estoy empezando a clasificar este punto de mi escritura del post como del tipo "ya ponte a trabajar", así que... nos vemos luego!

miércoles, enero 30, 2008

¿Para qué me sirve este blog?

Está bien, me digo a mi mismo, pues me he quedado con una pregunta hipotética en mi mente. La pregunta es: Si yo fuese un lector de este blog, para qué me serviría leer lo que se ha publicado acá (hasta el momento)? ¿y el blog en general?

Así que me animé a escribir nuevamente hoy (lo cuál debe ser una especie de record para mi en este blog!), para responder esta pregunta a mis amigos imaginarios (invisibles, diría Uslar Pietri).

Empecemos, aprovechando que son pocos posts, enumerándo las preguntas que podrían ser respondidas en cada uno de los posts:

  1. Máquinas de Aprendizaje ¿con Investigación de Operaciones?
    • ¿Cómo hago si no encuentro como entrenar una red de clasificación binaria?
    • ¿La Investigación de Operaciones me sirve para Inteligencia Artificial?
    • ¿Es Backpropagation (Retropropagación) la mejor forma de entrenar un perceptrón multicapa?
    • ¿Cómo se relaciona la Minería de Datos con la Investigación de Operaciones?
    • ¿Cómo se relacionan la Inteligencia Artificial, las Máquinas de Aprendizaje, la Minería de Datos, las Redes Neurales, la Invesgiación de Operaciones y la Optimización?
    • ¿Qué ideas critica Orestes? (esta es la que menos probablemente se hagan ustedes, pero la que me gustaría que más se hicieran!)
  2. ¿Dónde está el área de Investigación de Operaciones?
    1. ¿En qué departamentos de una universidad puedo encontrar a los profesores e investigadores del área de Investigación de Operaciones?
    2. Mi área es Investigación de Operaciones ¿en qué tipo de lugares debo meter el curriculum vitae en una universidad?
  3. ¿Qué es la Investigación de Operaciones?
    Ya el título es la pregunta, obviamente. Sin embargo, por no dejar, diré acá que esa pregunta puede surgir tanto a una persona de otra área, a la que le salieron con "la palabrota", como a una persona que sencillamente está buscando hacer un postgrado y quiere saber un poco más sobre esto de la IO.
    Yo se los digo, créanme: resulta particularmente confuso y "generaloide" leer la mayoría de las definiciones que hay por ahí. Para quitarse la triste sensación de que los únicos que saben qué es la investigación de operaciones, son los que trabajan en eso, puede ser que este post les de un respiro.
  4. Comienzo de divulgación de mis aportes durante la Maestría
    • ¿Cuáles son las grandes áreas de la Ingeniería de Sistemas?
    • ¿Qué motivó a Orestes a abrir este blog? (el que aún luego de leer lo de arriba, sienta que el blog no se justifica, podría hacerse esta pregunta)
      Claro está, que aún no he cumplido con la "impetuosa necesidad de comunicar mis aportes... etc etc", porque no quiero soltarlos sin contexto. Quiero comunicar mis aportes, luego de poner en el tapete todas las ideas que se necesitan para que al leer mis aportes no se queden con la pregunta mental "¿where are you coming from, Orestes?". Quiero asegurarme de que pongo las ideas de la manera más sencilla y clara posible, en parte para que el mensaje llegue a quienes no son expertos en el área, y en parte porque me gusta contar esto como un cuento que todos puedan más o menos entender (con un poco de investigación en wikipedia, si hace falta!).
  5. My own introduction to Neural Networks (spanish)
    • ¿Qué son las redes neurales artificiales?
    • ¿Para qué sirven?
    • ¿Qué las hace diferentes al cómputo clásico?
    • ¿Cómo me bajo el pdf de la tesis de maestría de Orestes? (LOL!)
Bueno. Ahora si me siento satisfecho. Procuraré, de ahora en adelante, hacer más énfasis en la utilidad de lo que escriba, porque en estos tiempos el ocio no es el que nos lleva a leer cosas como éstas!

Máquinas de Aprendizaje ¿con Investigación de Operaciones?

El tema del "Machine Learning" o de las Máquinas de Aprendizaje es un tema que en principio está en el terreno de la inteligencia artificial, pues cuando queremos que una "máquina" (en general un "ente" artificial) aprenda, básicamente estámos tratando de emular la forma en que el ser humano, a partir de su experiencia, logra tomar deciciones apropiadas, y esto, evidentemente, es parte de lo que llamamos "inteligencia".

Claro que este blog no es un blog de inteligencia artificial, sino de Optimización y Máquinas de Aprendizaje. Así que de ahí se puede desprender una razonable sospecha de que no voy a tratar a las máquinas de aprendizaje de modo general, sino sólo en los aspectos que tiene en común con el área de la Opimización (métodos prescriptivos de Investigación de operaciones, que comenté en un post anterior).

¿Y cuáles son esos tópicos de Máquinas de Aprendizaje que tienen que ver con Optimización? No pretendo en esto mostrar una lista completa de los tópicos, ya que mis conocimientos no abarcan con suficiente profundidad todos los tópicos de las Máquinas de Aprendizaje. Simplemente diré en respuesta a ello, me referiré en particular a los Algoritmos de Aprendizaje Supervisado.

El Aprendizaje Supervisado, como casi todos los tópicos de Máquinas de Aprendizaje, ha sido atacado desde enfoques estadísticos, de redes neurales, y ciencias teóricas de la computación. Son raros los casos en los que se enfrentan estos problemas desde el enfoque de la optimización. En particular, el área del "Data Mining" o Minería de Datos tiene importantes exponentes del área de optimización como lo son las diferentes técnicas de las famosas SVM o Máquinas de Vectores de Soporte.

Estas tienen como particularidad que minimizan el error de clasificación empírico (de allí que sean de Aprendizaje Supervisado) al mismo tiempo que maximizan la distancia que tiene la superficie separadora de las dos clases respecto a los elementos de esas clases que separa. Los problemas de minimización o maximización siempre buscan el comportamiento óptimo de un sistema. En este caso, la función a optimizar es al mismo tiempo los errores y el mencionado margen. Esta optimización simultánea fue deducida por Vapnik como parte de los aportes colaterales de sus nuevas propuestas en el área de la estadística, con apoyo de Chervonenkis.

Hay otros métodos de optimización que atacan problemas de Minería de Datos, por supuesto. Uno de ellos que me parece extremadamente interesante, aunque luego de su surgimiento no ha habido grandes avances en ese respecto, son los métodos "multi-superficie". En ellos se generan, siguiendo una estrategia "golosa", múltiples superficies, que seccionan el espacio en el que se encuentran los elementos a ser clasificados. La máquina de aprendizaje resultante no hace otra cosa que evaluar en cuál de las áreas delimitadas por esas superficies está el individuo que se desea clasificar. La respuesta es: la misma clase que tienen mayoritariamente los individuos de esa área.

Este tipo de estrategias generan, como sub-producto de su uso, el diseño de una red neural (perceptrón multicapa), o un árbol de clasificación.

En mi opinión es muy interesante el hecho de que algoritmos como estos puedan generar redes neurales de clasificación binaria "sin intervención humana". Es bien sabido en la comunidad de las redes neurales, que resolver un problema con redes neurales, la mayor parte de los casos puede considerarse no sólo una ciencia sino un arte, debido a que hay muchas decisiones "arbitrarias" que tomar, y que por ende provocan largas sesiones de ensayo y error, tanteo, o entonamiento. Hay que decidir, cuantas neuronas usar, de qué tipo, conectadas en qué forma, y por si fuera poco, luego decidirse por una estrategia para el entrenamiento.

El uso de algoritmos que propongan ya de por si la estructura y parámetros de la red, hace que el proceso de construír una red neural de clasificación deje de ser un arte, para empezar a convertirse en un proceso ya automático.

Por último, en este post de reflexiones sobre el uso de la optimización para resolver problemas de máquinas de aprendizaje, quiero asomar una idea. Invariablemente, la construcción de máquinas que aprendan a hacer clasificación binaria, basándose en los errores, implica el uso de técnicas para conseguir parámetros óptimos para esas máquinas. En el caso de las redes neurales como los Perceptrones Multicapa, es común el uso de algoritmos asociados al Backpropagation. Mi comentario es el siguiente: desde el punto de vista de optimización, la forma en que se plantea el problema que resuelve la retropropagación, es el tipo de problemas que todo optimizador quiere evitar, ya que:
* la función a optimizar no es convexa
* hay abundancia de óptimos locales
* hay abundancia de puntos estacionarios en los que un algoritmo de optimización fácilmente "cree haber llegado".

Para evitar algunos de esos problemas, se "distorciona" la función de transferencia de las neuronas del perceptrón multicapa, para que la función sea una sigmoidal "suave", en lugar de una función tipo "escalón", lo que da orígen a clasificaciones difusas (sin que en ello esté involucrada la batería de herramientas de las que se aprovisiona la lógica difusa para resolver estas situaciones).

Bueno, es probable que el 99.99% de las personas que lean esto se pregunten ¿y cómo piensa Orestes entrenar un perceptrón sin usar los principios de la retropropagación? Bueno. La respuesta es: buscándole la vuelta al problema, para sólo resolver problemas convexos. Más adelante les seguiré contando.

¿Dónde está el área de Investigación de Operaciones?

Quisiera contar acá una anécdota curiosa. Ya en mi artículo anterior mencioné la dificultad que tiene la gente de Investigación de Operaciones para responder a la pregunta “¿a qué te dedicas?”. Mucha gente cree que esto es una broma de profesor, pero ésto es tan serio, que ha dado lugar a situaciones confusas a nivel académico. Los matemáticos dicen que es una disciplina de los computistas. Los computistas le echan el muerto a los matemáticos. En la Universidad Simón Bolívar, los especialistas en esta área estaban inicialmente divididos en los departamentos de Matemáticas y Computación, y realmente muchos de ambos departamentos opinaban que debían estar en el otro. Luego se creó un departamento de Cómputo Científico y Estadística, que albergó a muchos de estos académicos. También surgió un departamento de Procesos y Sistemas (al cuál estuve adscrito mientras me dedique a labores académicas), que también albergaba a otro tanto.

En conclusión, tenemos una gran cantidad de personas que trabajan en los mismos problemas de forma aislada, probablemente usando muchas técnicas en común, y otras que ellos conocen sólo en su departamento y que podrían servir a los de los otros departamentos. Gente en lugares distintos trabajando sobre lo mismo, inevitablemente desembocará en fenómenos de “reinvención de la rueda”, en competitividad mal enfocada, y en que las personas no sepan a qué departamento ir, ante una duda. Obviamente, siendo una universidad de tipo experimental, donde las coordinaciones agrupan a las carreras, y los departamentos agrupan a los profesores, surge también la pregunta: “Quiero que los alumnos de la carrera X vean la materia Y, cuál departamento debería ofertar esa materia?”.

Como pueden ver, no siempre un "chiste de profesor" carece de seriedad.

No en vano dicen que el humor es el patio trasero de la inteligencia

martes, junio 05, 2007

¿Qué es la Investigación de Operaciones?

Investigación de Operaciones (también llamada Investigación Operacional), hoy en día es el nombre que se le da al “Análisis de Sistemas”. Realmente este último término suena como algo vago, pero ya veremos a qué se refiere.

El término “Operaciones” está heredado de las “operaciones militares", que vieron nacer a las técnicas y metodologías que ahora llamamos “Investigación de Operaciones”. En su orígen se trataba de “cumplir los objetivos”, sujetos a las "restricciones" que la situación de guerra exigía, con la "menor" cantidad de pérdidas.

Usted podrá decir: ¡Pero esto es algo que todo el mundo hace todo el tiempo, para ir a la oficina, para comprar en el supermercado, y quizá hasta para escoger una película en el cine!

Y lo dice con toda razón. Pero el hecho de que hayan llamado a un montón de matemáticos para que investigaran y desarrollaran una forma matemática de ayudarse en ese proceso, fue lo que dio orígen a todo esto. Y de allí que los militares decidieran agregar el otro término “Investigación”. Evidentemente el uso de esa palabra no implica necesariamente nada matemático,.. pero no me culpen a mi por ello!

En la actualidad, no es más que el uso de métodos cuantitativos para analizar sistemas (que no tienen una “manera tradicional” de modelarse matemáticamente).


Por ejemplo: existen ecuaciones perfectamente definidas para describir el movimiento de una roca lanzada en cierto ángulo y concierta velocidad. Sin embargo, qué pasa si tenemos una situación en la que la velocidad con que vamos a lanzar el objeto nos hace gastar más energía, y tenemos varios objetivos a los que queremos golpear, y tenemos que re-dirigir el cañón para apuntar al siguiente objetivo? ¿qué pasa si queremos disparar a todos los objetivos usando la menor cantidad de energía y empleando el menor tiempo posible? En esta situación, que ya es más compleja, si bien se utilizan modelos matemáticos clásicos (los que describen el lanzamiento de un proyectil), el modelo para esa “operación” es algo que hay que elaborar especialmente para ese tipo de situación.

Lo que hay que determinar en este “sistema” o en esta “operación”, es qué va a hacer el cañón en cada momento, y esto no es más que una serie de decisiones. Por ello se dice que la Investigación de Operaciones es una “ciencia de las decisiones”, significando con ello, que implica el uso del método científico para soportar la toma de decisiones.

Uno oye eso de “Decisiones” y cree que se trata sólo de “Gerenteces”. Pero en este caso podemos ver que no es así. Si estamos estudiando un sistema de reconocimiento de huellas dactilares en una base de datos de la policía, el que la computadora “diga” que “esta huella es de la misma persona que esta otra huella”, es también una decisión. También lo puede ser, el administrar el accionamiento o no de turbinas en un sistema de represas, para manejar los requerimientos energéticos de la zona, y al mismo tiempo mantener de forma adecuada los niveles de agua; o el encontrar la ruta más corta entre dos puntos en una ciudad.

El Diccionario Web de Cibernética y Sistemas, dice que la Investigación de Operaciones “es el enfoque de la ciencia moderna para atacar problemas en las áreas gerenciales y directivas de sistemas grandes de personas, máquinas, materiales, y dinero, en la industria, gobierno y defensa” (la traducción es mía). Uno puede pensar que la descripción es demasiado amplia. Yo creo que definitivamente es demasiado limitativa, porque un sistema que se quiera analizar, puede perfectamente ser un ecosistema, y el interés por resolver el problema puede ser de una ONG, o de un particular. No importa quién desea que se resuelva el problema, ni importa (en mi opinión) si el problema involucra estrictamente personas, máquinas, materiales o dinero. Lo que importa es que hay un sistema “grande” (que implica la suficiente complejidad como para que la simple intuición no pueda darnos una respuesta satisfactoria y repetible), y que se empleen métodos cuantitativos para resolver las dudas. Para mi esto es Investigación de Operaciones.

Bueno, pero esto de “métodos cuantitativos” o “científicos” es bastante vago también, podrían decir (yo lo diría!). Y es que en realidad el enfoque particular de la Investigación de Operaciones por lo general cae en dos grandes tipos de métodos: Descriptivos y Prescriptivos.

  • Los Métodos Descriptivos, por lo general buscan describir mediante la emulación del comportamiento del sistema, bajo ciertas condiciones hipotéticas. El caso típico es el de los modelos de simulación. Uno decide bajo que condiciones estará funcionando el sistema, y lo simula, observando el comportamiento causado por esas condiciones. Esto permite entender mejor la sensibilidad que tiene el sistema a esas condiciones, y con ello permitir experimentar con un modelo ficticio, ahorrando los riesgos y costos asociados a experimentar con el sistema verdadero. Obviamente la experimentación otorga experiencia, la cuál permite luego tomar mejores decisiones. Hay que hacer énfasis en la naturaleza aleatoria de estos métodos. Lo que se aprende es el “comportamiento” general del sistema, pero no se sabe con certeza cuál será el resultado de la exposición del sistema a ciertas condiciones. No tanto por los errores en el modelaje, sino por el hecho de que estos modelos asumen que las condiciones y los procesos asociados al sistema son de naturaleza aleatoria. Sin embargo, ante la incertidumbre, con un enfoque estadístico se puede apoyar la toma de las decisiones.

  • Los Métodos Prescriptivos son, por su lado, los que no asumen (en principio) la naturaleza aleatoria de las condiciones y de los procesos que se llevan a cabo en el sistema. Así, no hace falta “experimentar”. Sencillamente son modelos en los que el resultado es “la mejor configuración” del sistema. Esa búsqueda implica la pre-suposición de un “óptimo”, no estadístico, sino totalmente determinístico. Si las relaciones y leyes que gobiernan al sistema son “tales”, y las condiciones variables pueden tener estos valores posibles, restringidos de “tal” manera, la mejor configuración de las variables es “ésta”. Obviamente se necesita una definición matemática de lo que es “mejor”, o, dicho de otra forma, una forma cuantitativa de comparar dos posibles soluciones, y saber cuál es mejor. Es importante siempre tener en cuenta que si las condiciones llegaran a ser distintas a las que se utilizaron para construír el modelo, esa "mejor solución" teórica, no lo sería en la realidad. El óptimo siempre existe, pero para el modelo teórico. ¿Cómo interpretar ese resultado adecuadamente para el sistema real, tomando en cuenta todos aquellos inponderables que no pueden modelarse? Ese es el principal reto de la optimización (también llamada "programación matemática").

De esta manera, según mi definición, uno puede usar la parte frita de su cerebro (LOL) para jugar “Age of Empires” o Monopolio “mejor”, o para tomar en cuenta riesgos, retornos de inversión, escenarios socio-económico-políticos para predecir y comparar las posibles decisiones, estrategias, políticas y controles posibles en la sociedad, y en ambos casos está haciendo Investiación de Operaciones.

Hay una página que, inspirada en este último tipo de modelos, se refiere a la Investigación de Operaciones como “La Ciencia de lo Mejor” (mala traducción mía de The Science of the Better). Allí ellos colocan su propia definición de esta área del conocimiento, y adicionalmente identificaron 5 signos que te permiten saber que puedes beneficiarte de la Investigación de Operaciones . Está buena esa parte, visítenla.

viernes, junio 01, 2007

Comienzo de divulgación de mis aportes durante la Maestría

Recientemente culminé una Maestría, y no he tenido oportunidad de compartir mis aportes sino con pocas personas. Esto es porque mi ex-tutor y yo aún estamos en gestiones para publicar un paper en una revista arbitrada, y porque las circunstancias y mis decisiones han tenido como efecto que yo haya estado trabajando en la empresa privada, como analista, y no cómo educador ni investigador. Eso, aunado al hecho de que, desde que empezaron a surgir aportes sentí una impetuosa necesidad de comunicarlos al mundo, para que fuesen aprovechados, y para entusiasmar a las personas a conocer un poco más sobre esta área del conocimiento que tuve la oportunidad de conocer más durante mis estudios de postgrado. Por ello, en este blog empezaré la labor de comentar, amenizar y enseñar, los conceptos básicos de los aportes que hice en mi Trabajo de Grado para la Maestría.

Empiezo, en este post, por aclarar sobre qué era la Maestría. El nombre oficial es "Ingeniería de Sistemas"... ese es el nombre oficial, repito, pero en realidad es un conglomerado de tres postgrados que son mutuamente excluyentes (al menos en pensum), con la excepción 2 materias obligatorias llamadas "tronco común", y algunas electivas. Las tres áreas son:

- Sistemas de Información
- Sistemas de Control
- Investigación de Operaciones

Las explico un poco:

Sistemas de Información: es la disciplina que se ocupa del desarrollo, análisis, y uso de las tecnologías de la información. También se preocupa por la influencia que puede tener la tecnología de la información en los diferentes aspectos de la actividad humana. Como las otras 2 ramas, parte de premisas de la Teoría General de Sistemas de Bertalanfy, para tomar esta perspectiva para estudiar los sistemas de información. Un sistema de información es un medio implementado de forma tecnológica, utilizado para recoger, almacenar, y diseminar expresiones lingüísticas, así como inferir conclusiones a partir de esas expresiones. Esto que he colocado está basado en la explicación que da Wikipedia sobre la entrada "Information Systems". Uno de los mejores profesores que yo he tenido el honor de conocer, decía que los inscritos en esta rama son la mayoria de los de la maestría, y además son los más frívolos, pues en definitiva esta es la rama mejor remunerada y más demandada en la industria y la empresa privada. También opina que es mucho más filosófica que las otras dos ramas, y menos técnica,... lo cual, añade con sorna, confirma las sospechas de frivolidad.

Sistemas de Control: el sistema objeto de estudio, para la rama de "Sistemas de Control", son todos aquellos dispositivos (o conjunto de ellos), que administran, comandan, dirigen, o regulan el comportamiento de otros dispositivos o sistemas. Para cumplir con estas funciones, por lo general los sistemas de control cuentan con:
  • "sensores" para conocer el estado actual de la parte de la realidad que se quiere controlar.
  • "referencia", que es la pauta del estado en el cual se desea que esté la realidad que se desea controlar.
  • "controlador", que es la parte del sistema de control que determina las correcciones que deben llevarse a cabo para que la realidad alcance el estado deseado.
  • "actuadores", que son las partes del sistema de control que afectan la realidad, alterando su estado.
Mi estimado profesor opinaba que los inscritos en esta rama eran unos desadaptados sociales... ;o) ya que se internan tanto en los modelos, que simplifican los modelos, que a su vez representan los sistemas para controlar otro sistema, que ya se olvidan de la realidad que estaban tratando de controlar.





Investigación de Operaciones:
Otro profesor mío decía que esta era la disciplina de matar más gente, lo más rápido posible, perdiendo la menor cantidad de recursos. Esta definición alude a que es una ciencia que surge sobre la base de requerimientos por parte de la milicia, de técnicas que permitieran ganar una ventaja sobre el enemigo, en el manejo de las operaciones. Sin embargo, llegados los tiempos de paz, la Investigación de Operaciones se tornó en una ciencia sumamente útil (bien utilizada), para casi cualquier ámbito en el que uno desee tomar decisiones sobre problemas complejos de la vida real, con una base científica para apoyar esas decisiones. Mi jocoso y admirado profesor opinaba que esta especie de "ingenieros de sistmas" (a la cuál pertence él), son una gente que no tiene nada claro en la vida. Si les preguntas hoy en qué trabajan, pueden responderte que en inversiones de la bolsa, mañana pueden responderte que en un estudio de dinámica de poblaciones de tortugas marinas, y pasado mañana en el diseño de rutas de circuitos en tarjetas impresas miniaturizadas, componente de la computadora de navegación de un satélite geoestacionario. Entonces... ¿A qué se dedican? eh... pues... no pueden responder!

Por ahora dejo esto acá... en el próximo post, hablaré más sobre qué trata el área de Investigación de Operaciones, y me internaré en el tema de las máquinas de aprendizaje.