Estos días unos cuantos compañeros me han pedido un curso acelerado y simple de R. Es decir, como entrar, como salir, como introducir datos y los comandos básicos, más algunos manuales para empezar a trabajar con este lenguaje estadístico y evitar otro software más caro, aunque quizás más fácil de empezar a usar.
A pesar de esto, mientras estoy preparando una guía para "dummies", me encuentro todos los días cómo estas mismas personas están trabajando con SPSS.
Nuestra Universidad ofrece este programa comercial para su uso interno. Por supuesto, SPSS es el paquete estadístico, de entre los que conozco, en el que más fácilmente se ejecutan órdenes, aunque no necesariamente donde más fácilmente se interpretan los resultados (sencillo "input", más complejo "output"). El problema fundamental está en que esa sencillez de hacer un análisis con dos clicks (a veces solo uno) hace parecer innecesario entender lo que estamos haciendo, con lo cual luego los usuarios básicos son incapaces de entender la salida. Peor aun, en ocasiones se aplican análisis equivocados, simplemente por que no saben que mecanismos internos ejecutan, y no conocen las características que deben cumplir las variables que entran en esos análisis.
Bien, es cierto que R, como programa que se ejecuta en un terminal, tiene una curva inicial más dura, o vertical, pero una vez superado este primer obstáculo, la propia rutina del programa nos obliga a saber lo que hacemos, al menos en parte, y nos ayda a entender más fácilmente lo que obtenemos, y cometer menos errores en la elección de las pruebas a realizar. Esperemos que tras el curso acelerado, al menos pueda hacer comprender este concepto.
Nos queda señalar que, como última contrapartida del software comercial, si por falta de presupuesto desaparece del portafolios de programas ofrecidos por las Universidades y administración, vamos a tener un problema grave si el personal no está preparado para usar otro software menos intuitivo, pero quizás más completo y versátil...
y además de libre, gratuito, mira tú.
Mostrando entradas con la etiqueta SPSS. Mostrar todas las entradas
Mostrando entradas con la etiqueta SPSS. Mostrar todas las entradas
viernes, 7 de marzo de 2014
miércoles, 15 de mayo de 2013
R, SAS y SPSS en la docencia
Esta entrada tiene que ver con una opinión que he leído en la red. En una entrada del blog de r4stats.com titulado "Forecast Update: Will 2014 be the Beginning of the End for SAS and SPSS?" el autor de la entrada (Bob Muenchen) señala y analiza una pronta caída de SPSS y SAS a nivel académico. Es más, señala la importancia que tienen los profesores en ese proceso. Como es natural, los alumnos tienden a usar las herramientas que sus profesores le han enseñado, aunque solo sea por evitar nuevos esfuerzos de aprendizaje. Como profesor de materias en la que la estadística es una herramienta fundamental, siempre he dicho que es un error enseñar a un alumno a usar programas cerrados, que no se sabe como están hechos y como funcionan, y mucho más aun, que tienen un coste que no permite que luego sean utilizados en sus ordenadores para practicar lo enseñado. En primer lugar, enseñamos a usar el ratón, no a aplicar estadística. En segundo lugar, provocamos el pirateo de programas comerciales. Por ello es mucho más adecuado la docencia en software libre, no solo por que suele ser gratuito, y permite su uso a cualquier usuario (profesor o alumno); además, en el caso de R, la forma de aplicarlo ayuda a entender lo que estás haciendo. Por ello espero que esta opinión sea cierta y que R aumente la cuota de uso, al menos desde un punto de vista académico,
miércoles, 6 de marzo de 2013
SAS, SPSS y R
Como se puede deducir de algunas de mis entradas, las herramientas informáticas más importantes en mi trabajo son los paquetes estadísticos. El camino de aprendizaje ha sido largo, sobre todo por que no soy matemático. He utilizado a lo largo del tiempo lápiz y papel, calculadora, pequeños paquetes específicos en basic, programas estadísticos más o menos complejos comerciales, gnumeric, aplicaciones on-line y paquetes completos, bien comerciales, freeware y de software libre. Precisamente mi orientación actual hacia el software libre ha provocado que dedique gran parte del tiempo a aprender las funciones de R.
Sin embargo, sigo recibiendo muchos correos de SAS y SPSS. Ambas ofrecen ofertas a precios que consideran bajos (a mi siempre me han parecido altísimos). Sin embargo en los últimos tiempos solicitan -amablemente, por supuesto- que cubra encuestas para saber que intereses tengo (fundamentalmente SAS) y ofrecen programas de formación de alto coste, al menos desde mi punto de vista (fundamentalmente SPSS). Me da la sensación de que SAS trata de reubicarse en un mundo en el que llegó a ser considerado el mejor paquete/lenguaje estadístico, pero del que está siendo desplazado por R, y IBM trata de conducir a SPSS a su forma de trabajo (equipo, formación, apoyo). Sin embargo creo que he realizado ya la transición del desierto y me defiendo aceptablemente en R y no pienso volver. Me gusta el software libre, por que es libre, por supuesto, pero también por que es gratuito, sobre todo en este momento tan complicado.
Para aquellos a los que su trabajo suponga el uso de la estadística, y si su empresa se lo permita, les recomendaría un esfuerzo para superar las primeras reticencias a un paquete/lenguaje que supone el uso del terminal y comandos escritos. La curva de aprendizaje inicial es aparentemente muy empinada, pero eso es solo por las facilidades gráficas que nos han dado desde la aparición de Windows 3.1. El control completo de la estadística, incluyendo también los programas comerciales, supone siempre acudir a comandos (syntax en SPSS, por ejemplo, con el que he trabajado muchos años), así que por muy gráfico y limpio que parezca un paquete, acabaremos en una ventana de comandos, blanco o negra, pero ventana de comandos.
Por supuesto, para aquellos que tengan un paquete preconfigurado que no puedan cambiar, nada que decir. Así hemos estado muchos, pero que no sea por falta de voluntad.
Sin embargo, sigo recibiendo muchos correos de SAS y SPSS. Ambas ofrecen ofertas a precios que consideran bajos (a mi siempre me han parecido altísimos). Sin embargo en los últimos tiempos solicitan -amablemente, por supuesto- que cubra encuestas para saber que intereses tengo (fundamentalmente SAS) y ofrecen programas de formación de alto coste, al menos desde mi punto de vista (fundamentalmente SPSS). Me da la sensación de que SAS trata de reubicarse en un mundo en el que llegó a ser considerado el mejor paquete/lenguaje estadístico, pero del que está siendo desplazado por R, y IBM trata de conducir a SPSS a su forma de trabajo (equipo, formación, apoyo). Sin embargo creo que he realizado ya la transición del desierto y me defiendo aceptablemente en R y no pienso volver. Me gusta el software libre, por que es libre, por supuesto, pero también por que es gratuito, sobre todo en este momento tan complicado.
Para aquellos a los que su trabajo suponga el uso de la estadística, y si su empresa se lo permita, les recomendaría un esfuerzo para superar las primeras reticencias a un paquete/lenguaje que supone el uso del terminal y comandos escritos. La curva de aprendizaje inicial es aparentemente muy empinada, pero eso es solo por las facilidades gráficas que nos han dado desde la aparición de Windows 3.1. El control completo de la estadística, incluyendo también los programas comerciales, supone siempre acudir a comandos (syntax en SPSS, por ejemplo, con el que he trabajado muchos años), así que por muy gráfico y limpio que parezca un paquete, acabaremos en una ventana de comandos, blanco o negra, pero ventana de comandos.
Por supuesto, para aquellos que tengan un paquete preconfigurado que no puedan cambiar, nada que decir. Así hemos estado muchos, pero que no sea por falta de voluntad.
miércoles, 29 de febrero de 2012
Software libre: R
Hoy he completado un artículo cuya estadística se ha realizado completamente en R. Esto me acerca más a un uso completo de software libre, ya que me libera de la necesidad de usar SPSS, que en mi caso suponía una máquina virtual de Windows. Solo me quedan dos barreras; un escáner incompatible -por ahora- a sane y la firma digital de las actas de las materias en las que soy profesor. La primera es sencilla -sustituirlo por otro, como hice con la impresora- y la segunda avanza (ver aquí, aquí y este último). Ahora solo queda que el artículo pase los referees correspondientes y se publique, que es lo que importa desde un punto de vista profesional; el software solo es una herramienta.
jueves, 5 de enero de 2012
De software propietario a libre. Lectura de ficheros de SPSS y R
SPSS es uno de los últimos pasos que me quedan en mi abandono progresivo de Windows y los programas propietarios. De hecho, mi último manuscrito lleva toda la estadística en R, sin ningún problema (regresiones logísticas paso a paso (el famoso anglicismo "stepwise"); uso del criterio de información Akaike; métodos Mantel-Haenszel para detección de variables confusoras con generación de figuras aclaratorias...). Sin embargo, hoy me he encontrado con un problema; tengo que hacer estadística con unos datos que solo tengo disponibles desde ficheros sav de SPSS. La función read.spss() del paquete foreign encontró un error en un punto determinado y era incapaz de recuperar para R el resto de los datos a partir del error. Para aquellos que tengan este mismo problema, la forma más sencilla es utilizar el propio SPSS y exportarlos en una formato legible por algún programa del que se disponga; por ejemplo, exportarlos con formato Excel y leerlos con Calc de LibreOffice. Con esta o cualquier otra aplicación de hoja de cálculo (por ejemplo gnumeric también vale) podemos convertir ese conjunto de datos en un fichero de texto tabulado. Nosotros, no anglosajones, como usamos comas para separar los decimales, no podemos exportar a un fichero csv, pero un fichero de texto plano, columnas separadas por tabulado, con comas como indicador de decimales y con primera línea con nombre de variables incluido se puede leer directamente en R con una función -read.delim2()- así
datos<-read.delim2("fichero")
En mi caso no tengo a mi disposición en casa un ordenador con SPSS; en los otros ordenadores de trabajo, todos con Fedora 16, no he conseguido aun hacer funcionar las máquinas virtuales de VirtualBox con Windows XP preparadas para el uso de SPSS, así que estaba en un problema. Por suerte, el software libre está siempre ahí para sacarnos de los problemas. He recurrido a PSPP, la aplicación libre alternativa a SPSS. con él he podido abrir perfectamente los ficheros para luego poder usarlos en R (o en el propio PSPP, llegado el caso).
Respecto a la pregunta del millón, ¿de donde viene el acrónimo de PSPP? No existe esa respuesta; mirar aquí.
datos<-read.delim2("fichero")
En mi caso no tengo a mi disposición en casa un ordenador con SPSS; en los otros ordenadores de trabajo, todos con Fedora 16, no he conseguido aun hacer funcionar las máquinas virtuales de VirtualBox con Windows XP preparadas para el uso de SPSS, así que estaba en un problema. Por suerte, el software libre está siempre ahí para sacarnos de los problemas. He recurrido a PSPP, la aplicación libre alternativa a SPSS. con él he podido abrir perfectamente los ficheros para luego poder usarlos en R (o en el propio PSPP, llegado el caso).
Respecto a la pregunta del millón, ¿de donde viene el acrónimo de PSPP? No existe esa respuesta; mirar aquí.
domingo, 6 de noviembre de 2011
Recuperación en terminal de volúmenes perdidos en compresiones rar multivolumen
Lo prometido es deuda, y un comentario me ha recordado que aun no había mirado la recuperación de volúmenes rar perdidos en el terminal de Linux. No lo había mirado por que cobardemente estaba recuperando los volúmenes en una máquina virtual de Windows con un WinRar shareware sin licencia. Los días de prueba se han terminado, otra razón más para solucionarlo con terminal. En el fondo, es muy sencillo.
Paso 1. Instalación de rar - un simple sudo apt-get install rar
Paso 2. La orden, por si no nos acordamos, la podemos consultar a través de man rar, y entre las opciones, la que nos interesa es la rc
Paso 3. Como prueba he borrado el paquete 4 de una compresión multivolumen. Para facilitar la acción, he corregido el nombre, lleno de espacios, que en terminal de Linux son siempre un problema, por una simple f. Como se ve en la imagen, falta el volumen 4.
Paso 4. Ejecutamos el comando rar con la opción rc
rar rc f.part01.rar
En el caso de WinRar es necesario llamar a los ficheros rev; en este caso, la opción rc nos permite llamar al multivolumen. El comando calcula los volúmenes, observa el número de volúmenes de recuperación y cuantos paquetes faltan y comienza la reconstrucción
Paso 5. Listo. Todo ha funcionado. Reconstrucción 100% realizada.
Aquí esta el paquete.
Otras dudas:
Si me faltan volúmenes de recuperación, ¿qué puedo hacer? Solo es necesario tener tantos volúmenes de recuperación como paquetes nos falten. Por ejemplo, en este caso he borrado el primer volumen de recuperación y el paquete 14; como le quedan 2 volúmenes de recuperación (2 y 3) puede recuperar perfectamente el que falta.
Como decía antes, en WinRar hacía un doble click en cualquiera de los volúmenes rev y el programa comienza. En el terminal también vale. La orden ha sido
rar rc f.part01.rev
es decir, llamando al primer paquete de recuperación. Como disponemos de tres volúmenes de recuperación, para terminar la prueba, he borrado hasta tres paquetes que el programa debería poder recuperar.
El resultado ha sido perfecto.
Mediante estas opciones en el comando rar nos ahorramos tener que usar una máquina virtual para esto, que solo da más color, a cambio de un consumo increíble de recursos.
Si lo que queremos es hacer la compresión multivolumen, también se puede hacer en el terminal. Para una ayuda más completa que la indicada mediante man rar, puede ser interesante acudir al fichero rar.txt, que está, al menos en esta distribución (Ubuntu 11.10), en el directorio /usr/share/doc/rar comprimido como rar.txt.gz.
Si después de salvar los paquetes tenemos problemas con los caracteres en el terminal (no reconocimiento de ñ o letras acentuadas), como ya había señalado en la otra entrada, se desinstala rar. Si lo necesitamos otra vez, se instala de nuevo; son solo unos segundos.
Sin embargo, no debemos olvidar lo que dice la documentación del paquete (por ejemplo, ver en Synaptic) "This program is shareware and you must register it after 40 days of use.". Es decir, sigue siendo de pago.
Respecto a la pregunta de por que realizo la prueba en un directorio llamado Compartido_VirtualBox, diré que ese es el directorio en mi máquina para el intercambio Linux-Windows, a través de VirtualBox. Pero solo hasta hoy, ya que no preciso WinRar. El único vinculo que queda para mantener VirtualBox y Windows XP es SPSS. Va a ser difícil librarme de él, por que algunas técnicas estadísticas aun no las domino en R y, además, R no dispongo de un paquete que haga CHAID. Tendré que valorar el uso de "tree" en vez de CHAID y comparar resultados.
Paso 1. Instalación de rar - un simple sudo apt-get install rar
Paso 2. La orden, por si no nos acordamos, la podemos consultar a través de man rar, y entre las opciones, la que nos interesa es la rc
Paso 3. Como prueba he borrado el paquete 4 de una compresión multivolumen. Para facilitar la acción, he corregido el nombre, lleno de espacios, que en terminal de Linux son siempre un problema, por una simple f. Como se ve en la imagen, falta el volumen 4.
Paso 4. Ejecutamos el comando rar con la opción rc
rar rc f.part01.rar
En el caso de WinRar es necesario llamar a los ficheros rev; en este caso, la opción rc nos permite llamar al multivolumen. El comando calcula los volúmenes, observa el número de volúmenes de recuperación y cuantos paquetes faltan y comienza la reconstrucción
Paso 5. Listo. Todo ha funcionado. Reconstrucción 100% realizada.
Aquí esta el paquete.
Otras dudas:
Si me faltan volúmenes de recuperación, ¿qué puedo hacer? Solo es necesario tener tantos volúmenes de recuperación como paquetes nos falten. Por ejemplo, en este caso he borrado el primer volumen de recuperación y el paquete 14; como le quedan 2 volúmenes de recuperación (2 y 3) puede recuperar perfectamente el que falta.
Como decía antes, en WinRar hacía un doble click en cualquiera de los volúmenes rev y el programa comienza. En el terminal también vale. La orden ha sido
rar rc f.part01.rev
es decir, llamando al primer paquete de recuperación. Como disponemos de tres volúmenes de recuperación, para terminar la prueba, he borrado hasta tres paquetes que el programa debería poder recuperar.
El resultado ha sido perfecto.
Mediante estas opciones en el comando rar nos ahorramos tener que usar una máquina virtual para esto, que solo da más color, a cambio de un consumo increíble de recursos.
Si lo que queremos es hacer la compresión multivolumen, también se puede hacer en el terminal. Para una ayuda más completa que la indicada mediante man rar, puede ser interesante acudir al fichero rar.txt, que está, al menos en esta distribución (Ubuntu 11.10), en el directorio /usr/share/doc/rar comprimido como rar.txt.gz.
Si después de salvar los paquetes tenemos problemas con los caracteres en el terminal (no reconocimiento de ñ o letras acentuadas), como ya había señalado en la otra entrada, se desinstala rar. Si lo necesitamos otra vez, se instala de nuevo; son solo unos segundos.
Sin embargo, no debemos olvidar lo que dice la documentación del paquete (por ejemplo, ver en Synaptic) "This program is shareware and you must register it after 40 days of use.". Es decir, sigue siendo de pago.
Respecto a la pregunta de por que realizo la prueba en un directorio llamado Compartido_VirtualBox, diré que ese es el directorio en mi máquina para el intercambio Linux-Windows, a través de VirtualBox. Pero solo hasta hoy, ya que no preciso WinRar. El único vinculo que queda para mantener VirtualBox y Windows XP es SPSS. Va a ser difícil librarme de él, por que algunas técnicas estadísticas aun no las domino en R y, además, R no dispongo de un paquete que haga CHAID. Tendré que valorar el uso de "tree" en vez de CHAID y comparar resultados.
viernes, 4 de marzo de 2011
Kernel con PAE
Después del éxito de ayer con los 16GB de RAM he estado mirando para comprender como ha sido posible. Desde 1995 los procesadores, primero INTEL, y luego AMD, han incorporado una implementación llamada PAE (Physical Address Extension), en español Extensión de Dirección Física. Esta implementación permite a los procesadores x86 acceder a tamaños de memoria superiores a 4GB, llegando hasta 64GB. Esta implementación debe poder ser manejada por los sistemas operativos. Linux incluye un manejo completo de PAE desde el Kernel 2.3.23, pero solo se utiliza si se indica en la compilación. Es decir, necesita un kernel PAE. En teoría hacen falta tres pasos:
1. Activar PAE en la BIOS (no lo hice, por lo que supongo que en la BIOS de los ordenadores nuevos ya viene activada, o la han activado al montarlo).
2. Activar PAE en el kernel (no lo hice conscientemente, por lo que también hay dos opciones, que al actualizarse por su "propia voluntad" Linux midiera la RAM y decidiera instalar un kernel PAE o que en el ordenador anterior, con 4 GB de RAM, de donde extraje directamente los discos ya estuviera un kernel PAE).
De hecho, en la tercera foto de la entrada de ayer se ve en conky que el kernel está compilado con PAE (lo resalto ahora en azul).
3. Puede ser necesario configurar GRUB (ver aquí). Tampoco he tenido que hacerlo, así que supongo que grub se las ha arreglado solo.
En resumen; primero no necesito instalar por ahora una distribución de 64bits; dos, a pesar de no haber entrado en la BIOS, ni compilado ni configurado, todo funciona. Tres, aun tenemos una limitación; debido al límite de direccionamiento de 32 bits, cada proceso solo puede acceder en cada momento a 4GB. Como las máquinas que estoy usando albergan discos virtuales con Windows XP, ninguno necesita ni puede usar más de 4GB.
Solo quedan dos dudas; la primera, ¿se pueden usar dos máquinas virtuales con Windows XP simultáneamente? por que el ordenador solo tiene una licencia; lo digo desde un punto de vista legal.
Segunda, mi Universidad nos ofrece SPSS 64bits, con lo que haría que la potencía de cálculo fuera muy superior, al poder disponer de más memoria RAM para cada análisis. Esa es la única razón por la que sería interesante instalar una distribución de 64 bits y luego una máquina virtual con, por ejemplo, 7,5 GB de memoria asignada (es una suposición que hago sobre estas cifras; 16GB, menos 1GB para el kernel, la mitad para la máquina virtual, 7,5GB asignados).
1. Activar PAE en la BIOS (no lo hice, por lo que supongo que en la BIOS de los ordenadores nuevos ya viene activada, o la han activado al montarlo).
2. Activar PAE en el kernel (no lo hice conscientemente, por lo que también hay dos opciones, que al actualizarse por su "propia voluntad" Linux midiera la RAM y decidiera instalar un kernel PAE o que en el ordenador anterior, con 4 GB de RAM, de donde extraje directamente los discos ya estuviera un kernel PAE).
De hecho, en la tercera foto de la entrada de ayer se ve en conky que el kernel está compilado con PAE (lo resalto ahora en azul).
3. Puede ser necesario configurar GRUB (ver aquí). Tampoco he tenido que hacerlo, así que supongo que grub se las ha arreglado solo.
En resumen; primero no necesito instalar por ahora una distribución de 64bits; dos, a pesar de no haber entrado en la BIOS, ni compilado ni configurado, todo funciona. Tres, aun tenemos una limitación; debido al límite de direccionamiento de 32 bits, cada proceso solo puede acceder en cada momento a 4GB. Como las máquinas que estoy usando albergan discos virtuales con Windows XP, ninguno necesita ni puede usar más de 4GB.
Solo quedan dos dudas; la primera, ¿se pueden usar dos máquinas virtuales con Windows XP simultáneamente? por que el ordenador solo tiene una licencia; lo digo desde un punto de vista legal.
Segunda, mi Universidad nos ofrece SPSS 64bits, con lo que haría que la potencía de cálculo fuera muy superior, al poder disponer de más memoria RAM para cada análisis. Esa es la única razón por la que sería interesante instalar una distribución de 64 bits y luego una máquina virtual con, por ejemplo, 7,5 GB de memoria asignada (es una suposición que hago sobre estas cifras; 16GB, menos 1GB para el kernel, la mitad para la máquina virtual, 7,5GB asignados).
jueves, 3 de marzo de 2011
16GB RAM: Éxito inicial
El ordenador nuevo va como la seda. Por lo de pronto, saqué los discos del ordenador anterior, se los puse al nuevo y funciona perfectamente, sin ningún cambio. Se nota un rendimiento muy superior, por que cuatro años no pasan en balde. Por ahora no he instalado un sistema con 64 bits, pero si he podido aumentar la memoria de las máquinas virtuales, lo que me ha permitido arrancar SPSS en un tiempo razonable, y no los 7 minutos que tardaba antes. Hablando de máquinas virtuales, estoy usando VirtualBox 4.04 sin ningún problema; desde la entrada de Oracle, no las tenía todas conmigo (y sigo sin tenerlas).
Ccomentaremos los resultados cuando instale Ubuntu AMD64.
Ccomentaremos los resultados cuando instale Ubuntu AMD64.
jueves, 26 de marzo de 2009
SPSS
Después de haber preparado una máquina virtual con casi 3GB de Ram y solo para usar SPSS, me ha llevado todo el dia, desde las 10:30 hasta las 18:05 terminar 7 análisis. Cierto es que eran Analisis de varianza de muestras repetidas de 5 variables con 6 tomas consecutivas y que he aplicado un factor intersujeto, aparte de repetir todos los análisis utilizando primero el factor intrasujeto con el contraste Diferencia (ortogonal) y luego el contraste Repetido (no ortogonal). Es decir, muchos análisis y complicados, pero el nuevo SPSS v17 necesita lo menos un macroordenador como un rascacielos. Y menos mal que era una máquina virtual dentro de Ubuntu, por que en un ordenador con Windows instalado directamente es peor. PArece imposible, pero a mi me da esa impresión. Es decir, para extraer unos resultados, SPSS se pasa casi 8 horas extrayendo casi 500 folios de resultados. Menos mal que a veces aún usamos bolígrafo y los copiamos a mano (con 17 hojas fue suficiente extrayendo lo fundamental. SPSS saca mucha paja, no está para Linux en nuestra Universidad y cuesta una pasta. Es decir, menos mal que nos lo pagan, que si no estábamos servidos, por que quitándole unos cuantos (muchos) defectillos, es fácil de usar y bastante completo (aunque difícil de entender lo que sale; y si no, pregúnteselo a los alumnos).
jueves, 5 de febrero de 2009
SPSS y Answer Tree
A pesar de todo cuanto haya llegado a decir con respecto a SPSS (no hay más que ver aquí), no me ha quedado más remedio que comprar Answer Tree. Sí, como nuestra Universidad ya no cubre ninguna de las utilidades que antes si nos proporcionaba para hacer minería de datos (primero Aswer Tree, y luego Clementine), no nos ha quedado más remedio que comprarlo para su uso en nuestra Unidad. Y nos hemos comprado, por ahora, Answer Tree, pero seguramente en el futuro nos tendremos que comprar Clementine. En primer lugar Answer Tree sigue siendo la versión 3.1, como en el 2003. Segundo, solo cubre Algoritmos Chaid, Chaid exhaustivo, C&RT y Quest. He intentado con programas de codigo abierto o gratuitos hacerlo, pero el que me interesaba, el Chaid exhaustivo solo lo podía hacer con Sipina, y no he conseguido dominarlo (para ser exactos no he sido capaz de introducirle datos que comprendiera). He llegado a dominar parte de Knime, pero solo hace C&RT y C4.5, y no estoy seguro de que sea lo que más me conviene. Como mi tiempo no es infinito ni elástico, he decidido comprar con precio de docencia el Answer Tree, programa al que ya estoy acostumbrado por que lo usaba antes cuando nos lo ofrecía la Universidad. Cuando tengamos más tiempo y más dinero, compraremos el Clementine. Hace más cosas, esta en desarrollo, es más caro y necesitaremos tiempo para usarlo, ya que utiliza ese nuevo sistema de nodos para trabajar y no estoy muy acostumbrado (soy algo viejo para cambiar)
martes, 25 de noviembre de 2008
Estadística con SPSS
En nuestra Universidad disponemos de SPSS. Nunca me ha gustado mucho. Antes de usar este programa estaba acostumbrado a Systat, y me gusta algo más. Aún así hay que reconocer la gran variadad de análisis que puede realizar SPSS, pero siempre le falla algo en algún sitio. Como digo siempre, es culpa de la segunda s (spSs), que viene de Social sciences. Los sociologos no persiguen los mismos fines que las ciencias clínicas y sus algoritmos no suelen llegar hasta donde nosotros queremos. La solución sería probablemente usar R, pero no tengo tiempo para dominarlo y los programas que funcionan como guías (RCommander y otros) no llegan hasta donde nosotros necesitamos. En resumen, al realizar Análisis de varianza de muestras repetidas, nunca llega a la diferenciación entre pares al utilizar un factor intersujeto (por ejemplo contraste simple). La solución ha sido transformar manualmente los valores siguiendo la matriz de transformación según el factor intrasujeto y aplicar individualmente en cada toma a lo largo del tiempo un ANOVA univariable y aplicarle el factor intersujeto con un contraste Post-Hoc. Los resultados son identicos a los analisis Univariados que realiza la prueba de ANOVA repetido, pero esta vez aplica los Post-Hoc a cada toma, en vez de a todas juntas. En el fondo es sencillo, pero nos hace perder un tiempo precioso para llegar a obtene runos resultados que debieran salir fácilmente y a la primera. Así es la vida.
PD. Por cierto, el SPSS no funciona en Wine. Hay que usar una máquina virtual para que funcione. Me voy, por que estoy usando Windows y por fastidiar el acento está en la tecla de la ç y ésta en la del acento, con lo que tengo que corregirme continuamente. Seguiremos en Linux, no vaya a ser que me infecte de algo. Por cierto, que el pendrive ya me lo ha infectado de todo, pero en Linux lo borramos directamente -se ve el autorun y añadidos- y punto. Toma esta Microsoft
PD. Por cierto, el SPSS no funciona en Wine. Hay que usar una máquina virtual para que funcione. Me voy, por que estoy usando Windows y por fastidiar el acento está en la tecla de la ç y ésta en la del acento, con lo que tengo que corregirme continuamente. Seguiremos en Linux, no vaya a ser que me infecte de algo. Por cierto, que el pendrive ya me lo ha infectado de todo, pero en Linux lo borramos directamente -se ve el autorun y añadidos- y punto. Toma esta Microsoft
jueves, 19 de junio de 2008
Mejorando
Seguimos con el artículo en cuestión. Hoy, después de pensar profundamente (tercer sotano) y muy descontento de los resultados obtenidos, estadísticamente hablando, decidí segmentar de manera diferente los datos (después de pensar tanto, además de diferente creo que también de forma más adecuada). Alguna razón debería tener, por qué ahora sí sale lo que debiera ser, y hasta es comprensible y fácil de explicar, cosa que ni siempre pasa con esto de la estadística. Con ello ya tengo más encauzados los resultados y espero terminar durante la semana que viene. Pero no prometo nada, que en junio y julio hay una gran sobrecarga de trabajo (exámenes, tutorías, correcciones, papeles varios...). Eso sí, para terminar antes esta estadística, no quedó más remedio que utilizar SPSS. Es decir, conecté un portatil con Windows Vista y SPSS, ya que no he podido instalar SPSS a través de Wine en Ubuntu. El fin, es decir, publicar, justifica los medios; este pequeño pecado, utilizar el sistema operativo enemigo, es solo un pecado venial. Como tal, no rompe mi relación con Ubuntu, aunque la debilita, y por tanto alarga mi purgatorio (el uso de un sistema operativo imperfecto y malvado, que solo busca lucrarse). Sin embargo, como venial, no es obligatorio confesarlo. Salvo en el Blog, claro.
jueves, 22 de mayo de 2008
Algo liado
Intentaré mandar alguna nueva, pero estoy envuelto en estadística no paramétrica y multivariante, con lo cual lo único que tengo es dolor de cabeza. En todos estos días no hago más que trabajar con un ordenador en Linux, con OpenStat y Thunderbird, y otro con Windows para usar SPSS y Systat. y lo que falta. Seguiremos después.
Suscribirse a:
Entradas (Atom)










