Mostrando las entradas con la etiqueta parsimonia. Mostrar todas las entradas
Mostrando las entradas con la etiqueta parsimonia. Mostrar todas las entradas

domingo, febrero 13, 2011

¿Quien es un cladista?


Hace algún tiempo, alguien me preguntó en que se diferenciaba la cladística de los otros métodos filogenéticos. Para mucha gente, la respuesta es simple: un cladista es el que usa parsimonia (e.g. [1][2]).

Yo creo que la parsimonia es muy importante para los cladistas, pero no creo que uno sea cladista solo cuando usa parsimonia. Hay muchos artículos de autores que usan parsimonia, pero que no creo que sean artículos cladísticos. También hay trabajos de autores que no usan parsimonia, pero que están claramente dentro del marco cladístico (Pienso en los autores lejendarios: Hennig, Brundin, Wygodzinsky etc., todos ellos cladistas, pero ninguno uso parsimonia, al menos de una manera explícita [=numérica]).

Entonces, si no es un algoritmo ¿donde esta la diferencia? ¿cuando uno es un cladista?

Una parte escencial del pensamiento cladístico es la monofilia, pero actualmente la monofilia se entiende como un termino topologico (esto es, solo la relación representada en el árbol), pero creo que este pasaje de Hennig [3] es claro:
“La suposición de que dos o más especies están más cercanamente relacionadas entre si que con cualquier otra especie, y por ello forman un grupo monofilética, solo puede ser confirmada demostrando la presencia en común de un carácter derivado (“sinapomorfía”). Cuando ese carácter se a demostrado, entonces la suposición ha confirmado que lo han heredado del ancestro común únicamente para esas especies que muestran el carácter.”
Entonces, para un cladista, la monofilia no es solo la relación, sino los caracteres que apoyan esa relación. Cuando un cladista responde a la pregunta “¿es este grupo monofilético?” el /ella no muestra únicamente un árbol, sino además los caracteres que apoyan ese agrupamiento.

Entonces, la cladística no es sobre el algoritmo en particular usado para inferir las relaciones, sino sobre los caracteres que apoyan esos grupos. No es extraño entonces que la mayor parte de los cladistas usen morfología en sus análisis. Aún así, usando solo datos moleculares, se puede ser un cladista, cuando al referirse a calda clado, se discute también las sinapomorfías de dicho clado (sean moleculares y/o morfologicas). Después de eso, uno puede preferir cierto algoritmo sobre otro.

Aquí va un ejemplo, estos dos artículos, uno es de Wiens et al. [4] sobre la filogenia de los Escamados, y el otro es de Beutel et al. [5] sobre la filogenía de Holometabola. Ambos artículos usan parsimonia y análisis bayesiano de sus datos, y ambos parecen preferir los resultados del árbol del análisis bayesiano. Ambos artículos tienen más o menos el mismo tamaño (en cuanto a páginas), discuten las relaciones de grupos de gran diversidad y usan conjuntos de datos morfológicos y moleculares. Uno es claramente un trabajo cladístico, y el otro no.

Si uno mira el artículo de Beutel et al., uno se encuentra con un montón de discusión sobre los caracteres que apoyan cada clado. Para ellos, el apoyo no es solo el valor del apoyo de Bremer, la frequencia de Jackknife o la probabilidad Bayesiana, todo eso es importante por su puesto, pero no tiene sentido sin una referencia explicita a los caracteres que en el nodo. Entonces, así ellos prefieran el análisis bayesiano, ellos continúan siendo cladístas.

Del otro lado, esta el artículo de Wiens et al. Para estos autores, lo único importante son las relaciones, ellos discuten grupos y probabilidades bayesianas, pero nunca discuten ningún carácter de manera explicita para ningún grupo. Entonces, incluso si Wiens et al. solo hubieran usado parsimonia, ellos no son cladistas: los caracteres no son importantes para ellos.

Un cladista no es que escribe un artículo con las ultimas estrategías de búsqueda, o las medidas de apoyo, o la mayor cantidad de nuevos datos moleculares, o usa parsimonia. Todo eso es de gran importancia. Pero en un artículo cladístico, lo importante son los caracteres que apoyan la filogenía. Un buen artículo cladístico es un artículo sobre los caracteres.

Referencias
[1] Felsenstein, J. 2001. The troubled growth of statistical phylogenetics. Syst. Biol. 50: 465-467. Doi: 10.1080/10635150119297 [disponible gratis en el sitio de Syst. Biol.]
[2] Williams, D.M., Ebach, M.C. 2007. Foundations of systematics and biogeography. Springer, New York (USA).
[3] Hennig, W. 1965. Phylogenetic systematics. Ann. Rev. Entomol. 10: 97-116. Doi: 10.1146/annurev.en.10.010165.000525 [disponible gratis aquí]
[4] Wiens, J.J. et al. 2010. Combining phylogenomics and fossils in higher-level squamate reptile phylogeny: molecular data change the placement of fossil taxa. Syst. Biol. 59: 674-658. doi: 10.1093/sysbio/syq048 [disponible gratis en el sitio de Syst. Biol.]
[5] Beutel, R.G. et al. In press. Morphological and molecular evidence converge upon a robust phylogeny of the megadiverse Holometabola. Cladistics. Doi:10.1111/j.1096-0031.2010.00338.x [disponible gratis en el sitio de Cladistics]

martes, mayo 25, 2010

Hennig XXIX - Día 2 (24 mayo 2010)

Hoy fue un día un poco más “distendido” para mi :P pues tenía que dar mi paper, así que pues las minireseñas serán más pequeñas :P

Mi amiga Ivonne Garzón hablo sobre la filogenia de Hamadryas, unas mariposas que entre otras cosas, tienen la capacidad de hacer un ruidito, así que usando tanto datos morfológicos, como moleculares se preocupo, entre otras cosas, por detectar la historia de esa capacidad sonora.

Alejandro Oceguera, que había venido al meeting de Tucumán realizó un análisis molecular extensivo de Glossiphoniidae, un grupo de sanguijuelas. Infortunadamente era justo antes de mi charla, así que vi solo la mitad :-(.

Luego vino mi charla. Si alguno vio la pelí “El busca talentos” (es un clásico del cine beisbolero), o al menos, el principio, sabrá como me sentía :P. Es una comparación exagerada claro xD. Como sea, yo hable de lo que he estado laburando todo este tiempo, es decir, de metodología en biogeografía.

Tim Crowe, continua con su acumulación de evidencia sobre la filogenia de Galliformes, mostrando algunos de los problemas de usar algunos tipos de datos.

Vinieron los posters. Yo tenía un poster para mostrar (en colaboración con Dolores Casagranda), pero en mis olvidos se quedo en algún lugar de BsAs xP. Afortunadamente, gracias a Pablo Goloboff, Mark Siddall, Tim Gallaher y Stephanie Stephen pude conseguir ubicar el poster a tiempo! Vanessa Gonzalez que había estado en Tucumán, mostró un poster sobre la filogenia de un grupo muy diverso de bivalvos, me hubiera gustado que hubiera presentado esos resultados en una charla. Thomas Stach mostro una enorme acumulación de evidencia molecular para tratar de resolver las relaciones de los deuterostomos.
Marianna Teräväinen mostró los resultados de un análisis cladístico para reconocer las tradiciones medicinales de Vietnam, esa clase de trabajos donde se muestra el uso de análisis filogenéticos en otros contextos, donde claramente es aplicable me gusto mucho!

Volvieron las presentaciones, y Ward Wheeler dio una conferencia excelente, mostrando la relación entre modelos de likelihood y parsimonia de Sankoff. Estoy ansioso por ver sus resultados publicados y su reacción en la comunidad filogenética!

Ross Mounce comparo las relaciones entre particiones morfológicas (no siempre reconocidas) enfocándose en caracteres craneales versus caracteres no craneales y uso varias medidas para detectar que tan congruentes son, en un buen número de matrices de vertebrados.

Para terminar la mañana, Niels van Steenkiste dio su charla sobre las relaciones de Rhabdocoela, un grupo de platyhelmintos, en especial la relación entre los linajes marinos y los de agua dulce.

En horas de la tarde Lenka Drábková uso su trabajo en Juncaceae para determinar el uso de los barcodes en plantas. Sus resultados parecen apuntar a que los marcadores propuestos no son muy universales.

Prashant dio una segunda charla, esta vez ofreciendo una mirada a la filogenia de Grassatores un enorme clado de opiliones, cuya filogenia ha mostrado ser un hueso duro de roer.

La charla de Anna Phillips era sobre Hirudinidae, un grupo de sanguijuelas que por su gran importancia medica uno esperaría que fuera bien conocido. Pero como ayer mostró Lauren, ese no es el caso.--Por otros grupos que conozco de entomología medica y económica, al parecer la filog de esos grupos siempre es muy oscura :-/--.

El paper de Elizabeth Borda fue sobre Archinome, un genero de poliquetos marinos que viven en esas fumarolas de grandes profundidades, pero que también están asociados a la fauna que vive de las ballenas muertas.

Luego vino un batch de presentaciones más bien de evolución y desarrollo, especialmente en grupos marinos. Kevin Pang sobre Ctenophoros, Röttinger DuBuc sobre hemicordados, Yale Passamaneck en Brachiopodos y Mark Martindale sobre cnidarios, el origen del mesodermo y el blastoporo.

Así terminaron las presentaciones generales del 24. Hoy (25) es día libre, yo voy de hicking al cráter de diamond head, y en la noche es el banquete junto a la entrega de los premios de estudiantes. Los trabajos que más me gustaron a mi fueron los que dieron Varpu y Lauren el 23, y Alejandro y Anna (el 24) entre los trabajos empíricos. En lo metodológico, el que más me gusto fue el de Ross.

lunes, octubre 19, 2009

The behemot! for free! / El behemot gratuito!

Santí noted that the "behemot"'s paper [1] is now available for free from Wiley/Blackwell web-page, this is the link:


Or you can jump directly to the paper abstract and download the pdf:


If you want to look the results, Pablo post a quick guide to manage the trees and extract info from them. If you want to check you favorite group, or just play for a moment, there are no excuses ;)!

And the best of it, as they are macros, you can use for your own trees! and don't forget to check out the TNT wiki!


Santí me hizo notar que el paper donde el "behemot" vio la luz [1] se encuentra disponible de manera gratuita en el sitio de blackwell. El enlace es este:


O pueden ir directamente a la pagina del artículo y descargar el pdf:

Para quienes quieran jugar con los resultados, Pablo publicó una guía rápida para manejar los árboles y poder extraer info de ellos. Así que si tienen curiosidad por ver como quedo el grupo que ustedes trabajan, o simplemente quieren pasar un rato, ya no hay excusas ;)

Y lo mejor de todo, como son macros, se pueden usar en sus propios resultados :D! No se olviden de consultar la wiki de TNT ;)

[1] Goloboff, P.A. et al. 2009. Phylogenetic analysis of 73 060 taxa corroborates major eukaryotic groups. Cladistics 25: 211-230. DOI: 10.1111/j.1096-0031.2009.00255.x

martes, abril 28, 2009

Filogenia de 73060 eucariotas


Finalmente, el Behemot vio la luz. Nuestro paper de un análisis de parsimonia de 73060 especies de eucariotas (y 7800 caracteres mol+morf) acaba de ser puesto en linea en Cladistics [doi: 10.1111/j.1096-0031.2009.00255.x].



Pablo hizo un trabajo brutal optimizando cada cosa en las búsquedas de arboles con TNT. Y todos aquí trabajaron intensamente para poder manejar toda esa cantidad de datos!

Al principio me sorprendió la enorme exactitud de los árboles encontrados, porque el set de datos esta lleno de entradas faltantes. Además, me puse muy contento porque al incluir los datos morfológicos, aún a esta escala tan grande, los resultados fueron mejores que usando únicamente datos moleculares!

Hace uno meses, esto fue posteado en dechronization:
[Cassy Dunn] hizo un llamado convincente acerca de la necesidad de técnicas análiticas revolucionarias ahora que entramos en una era en que los alcances de la computación serán más limitantes que la disponibilidad de datos.
Yo creo que nuestro trabajo muestra exactamente lo contrario: nuestras herramientas de búsqueda son lo suficientemente buenas, pero no hay datos suficientes (el conjunto de datos más grande es SSU con 20000 especies, y solo un puñado de genes tiene más de 10000 especies).

Otra lección?.... No necesitamos los super-árboles!

viernes, abril 24, 2009

Algoritmos en filogenia 0a: Campos de bits


Intro

Quiero iniciar una serie de posts sobre los algoritmos usados en análisis filogenético. El motivo principal fue ver el árticulo sobre “filogenética computacional” (y los tópicos de sistemática) en wikipedia, que pues me parecen algo sesgados hacía los métodos basados en modelos, y en general los algoritmos de filogenia no están muy representados.

Hay un par de ejemplos muy buenos en i-net de algoritmos de filogenia, uno es el libro de Wheeler et al. [1], y en una vena similar, un manuscrito de DeLaet [2]. Sin embargo, los algoritmos que presentan son más bien generales, lo cual es muy bueno desde el punto de vista didáctico, pero en varios casos, alejado de lo que hacen los programas en la actualidad!

Como esas fuentes son muy buenas, espero enfocarme más en el aspecto de la implementación de los algoritmos. La idea es pasar de los más sencillos a los más complejos (en la medida en la que yo pueda comprenderlos xD).

Antes de empezar, pues quiero agradecer a Pablo Goloboff, que siempre ha estado dispuesto a discutir de algoritmos conmigo :). Por supuesto, los errores que tengan mis implementaciones son mis errores!

A medida que avance, iré posteando el código fuente en google code o sourceforge, por si desean examinarlo, requiere que sepan algo de C. El HTML tiene problemas con los símbolos mayor-que y menor-que, por los que los mostrare en estos posts como texto, en vez de usar el símbolo. Gracias a Rubén por el tip del HTML :)!

Campos de bits

Un componente básico del análisis filogenéticos son los caracteres. Asumamos que solo tenemos un carácter para cada terminal. Uno bien podría guardar cada estado en una variable, por ejemplo asignandole 0, 1, 2... según corresponda. Una idea así esta implícita en la descripción inicial del “groundpland divergence” de Wagner [3], y más o menos, en la formalización de Farris [4, ver 5]. Las operaciones entre caracteres serían operaciones de intervalos. Pero es mucho más sencillo ver a los caracteres como un conjunto de estados [4, 6]. Las operaciones entre caracteres serian operaciones de conjuntos. Esos conjuntos tienen además una característica particular: son perfectamente booleanos, es decir, un taxon tiene o no un determinado estado. Esto tiene dos consecuencias positivas: (i) podemos guardar el conjunto de estados como un campo de bits; (ii) las operaciones entre caracteres son operaciones de los campos de bits.

Las compus guardan los datos como números binarios. En un campo de bits, usamos esa particularidad para representar conjuntos de bits. Un ejemplo, aclara mejor la situación:
Estado    Representación binaria    "Número" (humano)
0 0001 1
1 0010 2
2 0100 4
3 1000 8
0, 1 0011 3
1, 3 0101 5
Como se ve, cada estado individual tiene su propio bit, y la combinación de estados es simplemente la unión los estados. Muchos lenguajes de programación incorporan operaciones para trabajar directamente con bits (not, and, or y xor) con lo cual la traducción de operaciones de conjuntos a operaciones de bits es directa.

En esta serie voy a utilizar un char para guardar los estados de carácter. En C, char es de 8 bits. Yo lo defino con un typedef, de manera que después es posible cambiar el número de bits en el bitfield.
#define BITS_ON_STATE 8
#define ALL_BITS_ON 255
typedef char STATES;
En este pequeño ejemplo, se leen los caractes de un taxon, desde un archivo (in), y se guardan en un array de caracteres (chars). El número de caracteres es nc, y se usan las funciones getc para leer caracteres de texto, SkipSpaces para ignorar los espacios de texto, y isdigit para reconocer si el carácter de texto es un número.
for (j = 0; j < nc; ++ j) {
error = SkipSpaces (in);
if (error != NO_ERROR) return error;
c = getc (in);
if (isdigit (c))
chars [j] = 1 < < (c - '0');
else if ((c == '?') || (c == '-'))
chars [j] = ALL_BITS_ON;
else return BAD_FORMAT;
}
En la operación chars [j] = 1 < < (c – '0') se resta el valor ASCII de '0' (30) al valor ASCII guardado en c (es un número, va de 30 a 39). El valor de esa resta lo usamos para correr los bits de 1. Así por ejemplo, si se lee un '0', la operación seria:
chars [j] = 1 < < (30 – 30)
chars [j] = 1 < < 0
[0000 0001 < < 0 = 0000 0001]
chars [j] = 1
Si leemos un 5
chars [j] = 1 < < (35 – 30)
chars [j] = 1 < < 5
[0000 0001 < < 5 = 0010 0000]
chars [j] = 32
Corrimos el 1 cinco bits a la izquierda.

Observen que los no aplicables o desconocidos, se codifican con todos los bits encendidos.

Esto funciona bastante bien para caracteres no aditivos. Para caracteres aditivos, es posible "recodificarlos" como varios caracteres binarios [7][8], una vez recodificados es posible utilizarlos como si fueran caracteres no aditivos independientes.

Hay formas más sofisticas de usar los campos de bits, uniendo varios caracteres en una sola variable (por ejemplo, en una variable de 32 bits, se pueden usar 8 caracteres de 4 bits, como nucleotidos) [8][9]. Ese empaquetado permite una evaluación muchisimo más rápida de los caracteres durante las búsquedas, puesto que en cada operación se pueden revisar simultáneamente varios caracteres.

Referencias
[1] Wheeler, W. et al. 2006. Dynamic homology and phylogenetic systematics: a unified approach using POY. American Mus. of Natural History, published in cooperation with NASA. online: http://research.amnh.org/scicomp/pdfs/wheeler/Wheeler_etal2006b.pdf
[2] DeLaet, J. 2005. Pseudocode for some tree search algorithms in phylogenetics. Manuscrito online: http://www.plantsystematics.org/publications/jdelaet./algora.pdf
[3] Wagner, W.H. 1961. Problems in the classification of ferns. En: Recent advances in botany. Toronto Univ. Press. pp. 841-844.
[4] Farris, J.S. 1970. Methods for computing Wagner trees. Syst. Zool. 19: 83-92.
[5] Goloboff, P.A. et al. 2006. Continuos characters analyzed as such. Cladistics 22: 589-601. doi: 10.1111/j.1096-0031.2006.00122.x
[6] Fitch, W.M. 1971. Toward defining the course of evolution: minimum change for a specific tree topology. Syst. Zool. 20: 406-416.
[7] Farris, J.S. et al. 1970. A numerical approach to phylogenetic systematics. Syst. Zool. 19: 172-189.
[8] Moilanen, A. 1999. Searching for most parsimonious trees with simulated evolutionary optimization. Cladistics 15: 39-50. doi: 10.1111/j.1096-0031.1999.tb00393.x
[9] Goloboff, P.A. 2002. Optimization of polytomies: state and parallel set operations. Mol Phyl. Evol. 22: 269-275. doi: 10.1006/mpev.2001.1049

viernes, diciembre 14, 2007

Muy buena noticia sobre TNT

En estos momentos no estoy en la ciudad, así que no puedo escribir posts muy largos :'(... pero no podia dejar pasar esta gran noticia sobre TNT. La Willy Hennig Society a tomado la financiación y apoyo a TNT (un programa de Pablo Goloboff, Steve Farris y Kevin Nixon), así que a partir de ahora el programa es gratuito! Solo hay que cumplir algunas condiciones muy simples: uso personal, y citar el programa--y como no la financiación por partde de la WHS--al publicar resultados.

En caso de que no lo sepan, TNT es el programa más rápido para análisis filogenético de parsimonia, que implementa muchos de los más recientes y eficientes algoritmos de búsqueda [1, 2], y un excelente y poderoso lenguaje de macros/scripts. Si ustedes realizan análisis cladísticos/filogenéticos, este es el programa ideal.

Yo adoro el editor de caracteres! Es muy fácil de usar, y mucho más intuitivo que WinClada, NDE o Mesquite (sip! Es mucho mejor que el de Mesquite!).

Pueden descargarlo aquí: http://www.zmuc.dk/public/phylogeny/TNT/
lean la licencia y a disfrútenlo :)

Cuando regrese a Bogotá completare las citas ;)

[1] Nixon, K.C. 1999. The parsimony ratchet a new method for rapid parsimony analysis. Cladistics 15: 407-414.
[2] Goloboff, P. A. 1999. Analyzing large data sets in reasonable times: solutions for composite optima. Cladistics 15: 415-428.

miércoles, noviembre 07, 2007

Homología y parsimonia

Este post esta inspirado ligeramente en la discusión ke han colocado Ebach y Williams en su blog systematics & biogeography. Mi intención es mostrar como se relaciona el análisis de parsimonia (o análisis cladístico) con la homología.

Homología

El termino homología tiene una larga historia de discusiones. Yo uso un poko la definición tradicional y tomo como homologas dos estructuras ke son consideradas la misma estructura en dos organismos diferentes. Uno puede usar múltiples argumentos para decir que significa ke una estructura sea la misma: el plan de Dios, el orden del universo, el tipo primordial, o la ke yo prefiero que es por ancestría común.

Cuando digo ke dos estructuras son homologas, implica ke son la misma estructura, y que esta a sido heredada de el ancestro común de ambos organismos. La herencia implica un montón de procesos, que se hayan implícitos en la definición: especialmente genética y biología del desarrollo. Además, las estructuras, a pesar de ser las mismas no suelen ser iguales, pueden estar fuertemente modificadas, pero aún así son la misma estructura, esto implica ke hay una transformación de las homologías, así entran en juego otros factores a nuestra definición como son los procesos ke desencadenan esas diferencias, como la interacción genética y la dinámica de las poblaciones.

En un análisis cladístico no hay una preocupación directa por todos esos fenómenos asociados a la homología. Esos procesos son más de interés de otras ramas de la biología como la evolución, le biología del desarrollo, la genética, la biología molecular, la genética de poblaciones, la ecología, etc. pero ke no sean de interés no implica ke sean ignorables: en la definición de caracteres (homologos) para el análisis cladístico muchos de esos factores entran en consideración para dar limite a los caracteres y como codificarlos.

Desafortunadamente, el ke el 'proceso' no sea preocupación de la cladística a llevado a la errónea idea ke es irrelevante en la definición de los caracteres. Así los cladístas de patrón (como Nelson, Platnick, o más recientemente Pleijel y Brower) consideran ke la cladística esta totalmente libre de todo pensamiento evolutivo, pero todo lo contrario: el usar caracteres homologos implica ke estamos trabajando en un marco ke esta basado en el origen por ancestría común, por lo tanto todos los estados de un carácter--y no solo los apomorficos--son la misma estructura.

Pero no solo eso, la implicación evolutiva es enorme para muchos caracteres, en especial si tenemos un buen conocimiento para el carácter, por lo ke la idea de Kluge (e.g. 2003) de ke solo es necesario 'descendencia con modificación' es también errada. Al introducir herencia y evolución, muchas más cosas se encuentran embebidas en la definición de cada carácter. Claro esta, eso depende de cada carácter, en muchas situaciones solamente tenemos un conocimiento morfológico del carácter, con lo ke lo único ke podemos asumir es la simple 'descendencia con modificación', pero en muchos grupos (como los vertebrados), el conocimiento ke se tiene sobre los caracteres es mucho más amplio, incluyendo por ejemplo un buen conocimiento del desarrollo de la estructura.

Parsimonia: algoritmo

El algoritmo básico de parsimonia es bastante sencillo. Si keremos establecer el estado de carácter presente en un nodo A, cuyos descendientes son B y C, y de los cuales ya sabemos su estado de carácter, el estado de A es la intersección de los estados de B y C, si esa intersección es un conjunto vacío entonces el estado es la unión de los estados B y C. Esta unión implica ke ha habido un cambio (lo ke es llamado un paso). Optimizar los estados es un poko más complicado, pero esas operaciones son lo básico del algoritmo.

Asignación de estados con el algoritmo de parsimonia: (A) y (B) el estado del nodo ancestro 'x' es igual a la intersección del estado de los descendientes 'y', 'z', en este caso, blanco; (C) 'y' y 'z' no comparten ningún estado, por lo tanto el estado asignado a 'x' es la unión de los estados de los descendientes.

Es fácil notar ke el algoritmo es 'independiente' de los datos tomados, uno puede tomar cualkier clase de 'carácter' (en ciencias de computadores este problema es conocido como el problema del coloreado, y los 'caracteres' son colores en un mapa) y cualkier clase de terminales de análisis. Esa es una característica propia de los métodos formalizados como algoritmos. Dado esas circunstancias es necesario proveer una justificación del uso de un algoritmo particular para cada problema.

En cladística la justificación para el uso de parsimonia viene dada por el concepto de homología.

Parsimonia: análisis cladístico

Dado el concepto evolutivo de homología, su unión con el concepto algoritmico de parsimonia es directo. Si decimos ke un carácter, cualquiera ke sea su estado, es el mismo en dos organismos ke comparten un ancestro común, eso implica ke ese carácter es heredado del ancestro común, por lo tanto el ancestro común debe tener ese carácter.

Si además ambos organismos comparten la misma expresión del carácter, es decir su mismo estado, entonces ese mismo estado se encuentra en su ancestro común, si por el contrario ambos organismos tienen diferentes expresiones del carácter, el ancestro común tiene el carácter, pero no sabemos ke expresión pueda tener, por lo ke asumimos ke tiene alguno de los dos estados, y damos por hecho, ke si en realidad ambos organismos comparten ese carácter, debió haber ocurrido una transformación.

Como se puede ver, esa es exactamente la misma descripción del algoritmo de parsimonia. En cladística el algoritmo esta justificado pues los caracteres usados son tomados como homologos. En ese contexto el algoritmo maximiza nuestras proposiciones de homología al minimizar las transformaciones: de esa forma se asegura ke la mayor cantidad de organismos con el mismo estados de carácter kedan contiguos. Esto es minimización de hipótesis ad hoc de homoplasia (Farris, 1983).

Parsimonia y los tests de homología

Es una idea común entre los cladístas el argumentar ke parsimonia es un test de homología: la congruencia. Yo estoy en desacuerdo, pues como he argumentado akí la base de la parsimonia es asumir de plano ke las entradas para un carácter son homologas. Para mi los tests de homología son una condición previa del análisis cladístico.

Esos test pueden venir de muchas formas, bien sea basado en argumentos de morfología (usualmente llamada 'similitud'), posición anatómica, organización estructural, ontogenía, genética, en la mayor parte de los casos muchas de esas pruebas son conjuntas--por lo ke definir un carácter marca una fuerte carga teórica--es despues de haber examinado todas esas alternativas ke podemos tener un buen carácter. Es por eso ke una homoplasía es una hipótesis ad hoc: la homoplasia en el carácter solo esta justificada en relación con el cladograma.
Por supuesto, es necesario recurrir a la revisión de caracteres, y ciertamente es bueno revisar los caracteres homoplasicos, pero es igualmente valioso examinar todos los caracteres por igual. Es posible ke tengamos alguna duda acerca de como codificar caracteres, debido a su complejidad o porke son muy poko conocidos, en estos casos puede ser posible utilizar como apoyo el resultado ke producen diferentes tipos de codificación (esa es la alternativa ke usa Ramírez, en prensa, y en molecular Wheeler, 1996). Pero debo llamar la atención sobre eso: la codificación no esta 'avalada' por el cladograma, pues el argumento ke se utiliza para defender esa codificación es el mismo usado para la homoplasia: solo se justifica en relación con el cladograma, por lo tanto la codificación tiene un fuerte elemento ad hoc. Para esos casos yo preferiría ke se utilizara un eskema de pesado como el de Neff (1986): dado ke conocemos poko del carácter, tanto ke tenemos nuestras dudas para codificarlo, es mejor ke tenga un peso más bajo ke el de caracteres ke conocemos mejor.

**
Adicional: una especulación histórica

En este ensayo yo presente las ideas de homología y parsimonia por separado y luego las fusione. Lo hice así porke considero ke da claridad a la discusión. Sin embargo, históricamente el desarrollo fue muy entrelazado desde el inicio. Leyendo a Wagner (1961, desde el lado algoritmico) y a Hennig (1968, desde el lado lógico) es claro como ambas ideas son intercambiables desde el inicio. Ambas visiones kedaron integradas muy bien en Farris et al. 1970, ke a pesar de ser un intento de axiomatización, contiene ideas (para mi muy estimulantes) ke coinciden con muchos de los puntos expuestos akí. Así desde el inicio las ideas del análisis cladístico y de parsimonia estuvieron juntas.

Wagner, Hennig y Farris desarrollaron sus ideas desde un contexto de la morfología. Dayoff (1969) también experimento con varios algoritmos para secuencias moleculares, donde al menos por ahora, las ideas de homología son en muchos casos diferentes a el concepto de morfología, en su época (mediados de los 60s), no se exactamente ke pensaran de homología los moleculares, pero era claro ke ellos no creían ke dos bases (en el caso de Dayoff, dos aminoacidos) iguales en dos organismos implicaba un origen común, la idea de mutaciones constantes precluyo la idea. Es interesante ver ke Dayoff no pudo encontrar una forma adecuada de asignar estados en los ancestros.

Referencias
Dayoff, M.O. (1969) Computer analysis of protein evolution. Sci. Amer. 221: 87-95.
Farris, J.S. (1983) The logical basis of phylogenetic systematics. En: Platnick, N., Funk, V.A. (Eds.), Advances in cladistics, vol. 2. Columbia, New York. Pp. 7-36.
Farris, J.S., Kluge, A.G., Eckardt, M.J. (1970) A numerical approach to phylogenetic systematics. Syst. Zool. 19: 172-189.
Hennig, W. (1968) Elementos de una sistemática filogenética. Eudeba, Buenos Aires.
Kluge, A.G. (2003) On deduction of species relationships: a précis. Cladistics 19: 233-239.
Neff, N.A. (1986) A rational basis for a priori character weighting. Syst. Zool. 35: 110-123.
Ramírez, M.J. (2007) Homology as a parsimony problem: a dynamic homology approach for morgological data. Cladistics 23:xx-xx.
Wagner, W.H. (1961) Problems in the classification of ferns. En: Recent advances in botany, vol. 1 Univ. Toronto, Toronto. Pp. 841-844.
Wheeler, W.C. (1996) Optimization alignment: the end of multiple sequence alignment in phylogenetics? Cladistics 12: 1-9.