lunes, noviembre 26, 2007

A brief sketch of a program for phylogenetics

The last week is a nice week for me, as I received a grant to begin a graduate scholarship :) As my main objective is coupled with the development of a program, and my own interest in phylogenetics, and in a lesser extent, in software engineering, i will try to show here how I think a phyligenetic-related software would be implemented.

Do not take it for granted! The software projects in which i am involved to date, are smaller and short-term, and then I usually make some (ugly) shortcuts for immediate solutions but with low flexibility to modifications. Here my sketch take into account the possibility of further refinements of each part, so it is far more modular than my small projects.
Every program is composed with two parts. The first, the more messier and the most bored part to write, is the user interface (UI). The second, is the program itself (the core). In small projects you could mix both parts without much pain, but as the program growths leaving both parts mixed makes the program difficult to maintain: you would rewrite several code parts to introduce new input formats.

Ideally you would try to make the core to be totally independent from the UI, but usually it is not possible (unless your program do noting). An effort to construct a well designed communication between the UI and the core, is always well payed in the future.

I start my design with the core, and in every moment thinking how the core would communicate with a black-box UI. In phylogenetics you have two major parts: the matrix, and the tree. Both are composed of more smaller elements. The matrix is a list of labels, usually with some coupled data (taxon-character matrix, a taxon-distribution matrix). The tree is a topology in which each vertex is associated with the matrix labels.

You could think that both the tree and the matrix are the same, after all, the tree is only an specific way to sort the terminals in the matrix (it seems that TreeFitter[1] works in that way). But there is a difference, the terminals in the matrix are unique, but you could have many tress associated with the same matrix, terminal 'a' are independent in two trees, but they could point to the same element in a matrix.
Apart from terminals, that have a fixed content, internal nodes of a tree are coupled with the same sort of data as terminals, but this is a variable content, dependent on the tree topology. So we could implement a single fixed matrix, and one (or more) variable matrix, when the tree is unused, the variable matrix can be discarded.

To communicate the core with the UI, at this moment, I prefer string streams. They could be find in standard library (although with some little spelling differences), in that way the UI always translate between formats to send to the core specific strings, for example the tree in parenthesis format, so the tree construction would not interact with files, or console input, for example.

In that way, the UI is a central of translation from console, file, command dialogs, etc., that can be implemented for different systems (e.g. Win, Linux, command line), but the core remains the same.

[1] Ronquist, F. TreeFitter, program and documentation, available on line at: http://www.ebc.uu.se/systzoo/research/treefitter/treefitter.html

jueves, noviembre 15, 2007

Now in english

All the few previous post I made for this blog were in spanish, my mother language, for now I will try to post in both english and spanish. In english because everybody know that it is the science language, I want that other people interested in systematics, biogeography and specifically cladistics could read my blog! In spanish because I never found another cladistics blog in spanish. The content of posts would not necessarily overlap, I would try to provide translations of each post, but for my own convenience, I want to post technical posts--dealing with computer programming, databasing, and 'phyloinformatics', as Page call it--in english, and philosophical and methodological in spanish. I also want to post about true bug's (Insecta: Heteroptera) phylogenetics, I think I would use english.

I also want to increase the rate of postings ;) I hope, I could post at least one time per week ;).

As you could see, I am not a good english writer, so I hope that this blog could help me to write somewhat better :).

miércoles, noviembre 07, 2007

Homología y parsimonia

Este post esta inspirado ligeramente en la discusión ke han colocado Ebach y Williams en su blog systematics & biogeography. Mi intención es mostrar como se relaciona el análisis de parsimonia (o análisis cladístico) con la homología.

Homología

El termino homología tiene una larga historia de discusiones. Yo uso un poko la definición tradicional y tomo como homologas dos estructuras ke son consideradas la misma estructura en dos organismos diferentes. Uno puede usar múltiples argumentos para decir que significa ke una estructura sea la misma: el plan de Dios, el orden del universo, el tipo primordial, o la ke yo prefiero que es por ancestría común.

Cuando digo ke dos estructuras son homologas, implica ke son la misma estructura, y que esta a sido heredada de el ancestro común de ambos organismos. La herencia implica un montón de procesos, que se hayan implícitos en la definición: especialmente genética y biología del desarrollo. Además, las estructuras, a pesar de ser las mismas no suelen ser iguales, pueden estar fuertemente modificadas, pero aún así son la misma estructura, esto implica ke hay una transformación de las homologías, así entran en juego otros factores a nuestra definición como son los procesos ke desencadenan esas diferencias, como la interacción genética y la dinámica de las poblaciones.

En un análisis cladístico no hay una preocupación directa por todos esos fenómenos asociados a la homología. Esos procesos son más de interés de otras ramas de la biología como la evolución, le biología del desarrollo, la genética, la biología molecular, la genética de poblaciones, la ecología, etc. pero ke no sean de interés no implica ke sean ignorables: en la definición de caracteres (homologos) para el análisis cladístico muchos de esos factores entran en consideración para dar limite a los caracteres y como codificarlos.

Desafortunadamente, el ke el 'proceso' no sea preocupación de la cladística a llevado a la errónea idea ke es irrelevante en la definición de los caracteres. Así los cladístas de patrón (como Nelson, Platnick, o más recientemente Pleijel y Brower) consideran ke la cladística esta totalmente libre de todo pensamiento evolutivo, pero todo lo contrario: el usar caracteres homologos implica ke estamos trabajando en un marco ke esta basado en el origen por ancestría común, por lo tanto todos los estados de un carácter--y no solo los apomorficos--son la misma estructura.

Pero no solo eso, la implicación evolutiva es enorme para muchos caracteres, en especial si tenemos un buen conocimiento para el carácter, por lo ke la idea de Kluge (e.g. 2003) de ke solo es necesario 'descendencia con modificación' es también errada. Al introducir herencia y evolución, muchas más cosas se encuentran embebidas en la definición de cada carácter. Claro esta, eso depende de cada carácter, en muchas situaciones solamente tenemos un conocimiento morfológico del carácter, con lo ke lo único ke podemos asumir es la simple 'descendencia con modificación', pero en muchos grupos (como los vertebrados), el conocimiento ke se tiene sobre los caracteres es mucho más amplio, incluyendo por ejemplo un buen conocimiento del desarrollo de la estructura.

Parsimonia: algoritmo

El algoritmo básico de parsimonia es bastante sencillo. Si keremos establecer el estado de carácter presente en un nodo A, cuyos descendientes son B y C, y de los cuales ya sabemos su estado de carácter, el estado de A es la intersección de los estados de B y C, si esa intersección es un conjunto vacío entonces el estado es la unión de los estados B y C. Esta unión implica ke ha habido un cambio (lo ke es llamado un paso). Optimizar los estados es un poko más complicado, pero esas operaciones son lo básico del algoritmo.

Asignación de estados con el algoritmo de parsimonia: (A) y (B) el estado del nodo ancestro 'x' es igual a la intersección del estado de los descendientes 'y', 'z', en este caso, blanco; (C) 'y' y 'z' no comparten ningún estado, por lo tanto el estado asignado a 'x' es la unión de los estados de los descendientes.

Es fácil notar ke el algoritmo es 'independiente' de los datos tomados, uno puede tomar cualkier clase de 'carácter' (en ciencias de computadores este problema es conocido como el problema del coloreado, y los 'caracteres' son colores en un mapa) y cualkier clase de terminales de análisis. Esa es una característica propia de los métodos formalizados como algoritmos. Dado esas circunstancias es necesario proveer una justificación del uso de un algoritmo particular para cada problema.

En cladística la justificación para el uso de parsimonia viene dada por el concepto de homología.

Parsimonia: análisis cladístico

Dado el concepto evolutivo de homología, su unión con el concepto algoritmico de parsimonia es directo. Si decimos ke un carácter, cualquiera ke sea su estado, es el mismo en dos organismos ke comparten un ancestro común, eso implica ke ese carácter es heredado del ancestro común, por lo tanto el ancestro común debe tener ese carácter.

Si además ambos organismos comparten la misma expresión del carácter, es decir su mismo estado, entonces ese mismo estado se encuentra en su ancestro común, si por el contrario ambos organismos tienen diferentes expresiones del carácter, el ancestro común tiene el carácter, pero no sabemos ke expresión pueda tener, por lo ke asumimos ke tiene alguno de los dos estados, y damos por hecho, ke si en realidad ambos organismos comparten ese carácter, debió haber ocurrido una transformación.

Como se puede ver, esa es exactamente la misma descripción del algoritmo de parsimonia. En cladística el algoritmo esta justificado pues los caracteres usados son tomados como homologos. En ese contexto el algoritmo maximiza nuestras proposiciones de homología al minimizar las transformaciones: de esa forma se asegura ke la mayor cantidad de organismos con el mismo estados de carácter kedan contiguos. Esto es minimización de hipótesis ad hoc de homoplasia (Farris, 1983).

Parsimonia y los tests de homología

Es una idea común entre los cladístas el argumentar ke parsimonia es un test de homología: la congruencia. Yo estoy en desacuerdo, pues como he argumentado akí la base de la parsimonia es asumir de plano ke las entradas para un carácter son homologas. Para mi los tests de homología son una condición previa del análisis cladístico.

Esos test pueden venir de muchas formas, bien sea basado en argumentos de morfología (usualmente llamada 'similitud'), posición anatómica, organización estructural, ontogenía, genética, en la mayor parte de los casos muchas de esas pruebas son conjuntas--por lo ke definir un carácter marca una fuerte carga teórica--es despues de haber examinado todas esas alternativas ke podemos tener un buen carácter. Es por eso ke una homoplasía es una hipótesis ad hoc: la homoplasia en el carácter solo esta justificada en relación con el cladograma.
Por supuesto, es necesario recurrir a la revisión de caracteres, y ciertamente es bueno revisar los caracteres homoplasicos, pero es igualmente valioso examinar todos los caracteres por igual. Es posible ke tengamos alguna duda acerca de como codificar caracteres, debido a su complejidad o porke son muy poko conocidos, en estos casos puede ser posible utilizar como apoyo el resultado ke producen diferentes tipos de codificación (esa es la alternativa ke usa Ramírez, en prensa, y en molecular Wheeler, 1996). Pero debo llamar la atención sobre eso: la codificación no esta 'avalada' por el cladograma, pues el argumento ke se utiliza para defender esa codificación es el mismo usado para la homoplasia: solo se justifica en relación con el cladograma, por lo tanto la codificación tiene un fuerte elemento ad hoc. Para esos casos yo preferiría ke se utilizara un eskema de pesado como el de Neff (1986): dado ke conocemos poko del carácter, tanto ke tenemos nuestras dudas para codificarlo, es mejor ke tenga un peso más bajo ke el de caracteres ke conocemos mejor.

**
Adicional: una especulación histórica

En este ensayo yo presente las ideas de homología y parsimonia por separado y luego las fusione. Lo hice así porke considero ke da claridad a la discusión. Sin embargo, históricamente el desarrollo fue muy entrelazado desde el inicio. Leyendo a Wagner (1961, desde el lado algoritmico) y a Hennig (1968, desde el lado lógico) es claro como ambas ideas son intercambiables desde el inicio. Ambas visiones kedaron integradas muy bien en Farris et al. 1970, ke a pesar de ser un intento de axiomatización, contiene ideas (para mi muy estimulantes) ke coinciden con muchos de los puntos expuestos akí. Así desde el inicio las ideas del análisis cladístico y de parsimonia estuvieron juntas.

Wagner, Hennig y Farris desarrollaron sus ideas desde un contexto de la morfología. Dayoff (1969) también experimento con varios algoritmos para secuencias moleculares, donde al menos por ahora, las ideas de homología son en muchos casos diferentes a el concepto de morfología, en su época (mediados de los 60s), no se exactamente ke pensaran de homología los moleculares, pero era claro ke ellos no creían ke dos bases (en el caso de Dayoff, dos aminoacidos) iguales en dos organismos implicaba un origen común, la idea de mutaciones constantes precluyo la idea. Es interesante ver ke Dayoff no pudo encontrar una forma adecuada de asignar estados en los ancestros.

Referencias
Dayoff, M.O. (1969) Computer analysis of protein evolution. Sci. Amer. 221: 87-95.
Farris, J.S. (1983) The logical basis of phylogenetic systematics. En: Platnick, N., Funk, V.A. (Eds.), Advances in cladistics, vol. 2. Columbia, New York. Pp. 7-36.
Farris, J.S., Kluge, A.G., Eckardt, M.J. (1970) A numerical approach to phylogenetic systematics. Syst. Zool. 19: 172-189.
Hennig, W. (1968) Elementos de una sistemática filogenética. Eudeba, Buenos Aires.
Kluge, A.G. (2003) On deduction of species relationships: a précis. Cladistics 19: 233-239.
Neff, N.A. (1986) A rational basis for a priori character weighting. Syst. Zool. 35: 110-123.
Ramírez, M.J. (2007) Homology as a parsimony problem: a dynamic homology approach for morgological data. Cladistics 23:xx-xx.
Wagner, W.H. (1961) Problems in the classification of ferns. En: Recent advances in botany, vol. 1 Univ. Toronto, Toronto. Pp. 841-844.
Wheeler, W.C. (1996) Optimization alignment: the end of multiple sequence alignment in phylogenetics? Cladistics 12: 1-9.

jueves, noviembre 01, 2007

Pasando a BPR3

Ayer me entere ke existe una iniciativa, BPR3, blogs sobre investigación revisada por pares, y muy contento con esa idea me voy a poner a modificar mis post previos :), y realizar los futuros dentro de esa iniciativa :D

Pueden ver lo ke dice la gente de BPR3 en su blog oficial: bpr3.org
Y aquí pueden leer un poco sobre lo ke pienso de esa idea (en mi blog personal).

martes, septiembre 11, 2007

Tasa de 'poder explicativo'

Recientemente, Grant y Kluge (2007) propusieron la tasa de poder explicativo, una medida basada en el soporte de Bremer, para medir el soporte de las ramas. A diferencia del soporte de Bremer tradicional, esta medida es escalada, con lo cual es posible comparar el valor de soporte de varias ramas. En este pequeño ensayo trato de mostrar ke su medida no logra su cometido, y ke las soluciones ke ellos critican son mucho mejores.

La tasa de poder explicativo (REP por su nombre en ingles, Ratio of explanatory power) consiste en escalar el soporte de Bremer con la diferencia entre el mejor árbol posible y el peor. Es decir, el denominador es el numerador del indice de retención para todo el árbol. Así si un clado solo desaparece en el peor árbol, tanto el denominador como el numerador son iguales, y por lo tanto el REP=1, si un grupo es contradicho (o es ambiguo) y soportado en los árboles más parsimoniosos (i.e. esta en algunos árboles, pero no aparece en el consenso estricto), el REP=0. Aunque no es una idea explorada por Grant y Kluge, uno puede extender la medida para grupos no soportados entre los árboles más parsimoniosos, dando valores negativos, cuyo minimo seria REP=-1, en donde un clado solo aparezca en el peor árbol (en este caso, nunca aparece!).

Como es un valor escalado del soporte de Bremer, su utilidad se limita a comparar entre clados de diferentes conjuntos de datos, pero no para comprar clados dentro de un mismo conjunto de datos. Grant y Kluge, intentan dar una enumeración de los posibles usos de su medida, como por ejemplo para discriminar hipótesis biogeograficas, o para hacer superaboles. Es interesante hacer notar, que en un paper anterior, Grant y Kluge (2003, p. 384) estaban en contra de utilizar los valores de soporte altos, entre otras cosas para hacer análisis biogeograficos:

“[E]pistemologically, all clades in the least refuted cladogram(s) provide an equally valid basis for testing evolutionary scenarios (e.g., biogeographic hypotheses)...although it may be tempting to base such studies exclusively on the more strongly supported parts of a given cladogram, that procedure is a slippery slope to a verificationist interpretation of better-supported clades as more reliable or certain or closer to truth.”

Así si según Grant y Kluge uno no debe comparar entre clados de un mismo conjunto de datos, porke si podemos hacerlo con diferentes conjuntos? Es más, tiene más lógica ke uno compare el soporte de un clado de Dipteros, con por ejemplo, un clado de Asteraceas o Dinoflagelados?

Una utilidad ke parece más real, aunque de plano rechazada por Granty y Kluge, es komo una medida similar al soporte particionado de Bremer (Grant y Kluge estan en contra, continuamente recalcan ke se debe usar para comparar diferentes conjuntos de terminales) o en experimentos como los de Rydin y Källersjö (2002; que son de diferentes terminales, pero del mismo conjunto de datos). En ambos casos, el escalamiento es relativo al conjunto usado y permitiría ver en ke conjunto de datos, el soporte es relativamente más fuerte para cada grupo. Quizá sea la única utilidad posible para este método, ke de otro lado es solo una forma más difícil de expresar el soporte de Bremer.

Parecería mucho mejor una medida ke mostrar cuanto de la evidencia apoya al grupo en el árbol actual y cuan otra lo contradice! Grant y Kluge parecen no distinguir eso, ellos si un grupo es soportado en todos los árboles más parsimoniosos implica, como en la democracia norteamericana, ke toda la evidencia posible favorece al grupo:

“For example, two groups on the same tree may have identical [Bremer support] (and, therefore, identical relative explanatory power)” (p. 484).

Pero dado un conjunto de datos, uno puede tener caracteres ke apoyan la rama sin ser contradichos, mientras en otra rama, los caracteres ke la soportan son contradichos con homoplasia dentro del clado (i.e reversiones) o en ramas independientes (i.e. 'paralelismos'). En casos reales, lo más probable es ke tengamos el segundo caso, pero en diferentes grados, y una medida de soporte escalada debería ser capaz de distinguir esos grados. Esa medida es la Diferencia relativa de ajuste (RFD, relative fit difference, Goloboff y Farris, 2001).

La ventaja de esa medida escalada, discriminar grupos de acuerdo con la proporción de evidencia favorable ke tienen. Así, en contra de Grant y Kluge, uno puede encontrar ke hay grupos ke a pesar de tener un soporte de Bremer igual (es decir, ke tienen la misma cantidad de evidencia favorable), son contradichos de forma diferente, y por lo tanto no podemos decir ke tienen el mismo poder explicativo! Usando las palabras de Grant y Kluge, uno de los grupos esta más refutado (con más evidencia en contra) que el otro! Esa razón esta claramente expuesta en Goloboff y Farris, 2001 (p. S30-S31), contra Grant y Kluge que argumentan ke el RFD fue presentado sin mostrar porke dicha medida es útil, cosa ke al REP le keda más difícil demostrar!

El RDF no es, ni pretende ser una alternativa al soporte de Bremer, más bien, es un complemento a esa medida, tanto mejor para medir el 'poder explicativo'. Cabe anotar ke el RFD esta implementado en las versiones más recientes de NONA/Piwe (Goloboff, 1998) y en TNT (Goloboff et al., 2007).

El RDF no es perfecto, tal y como lo muestran Goloboff y Farris. Para mi el principal, es ke depende mucho de la pareja de árboles en las ke se basa la comparación. Así ke el tema rekiere seguir siendo investigado, pero más en el sentido de RFD (discriminar grupos dentro de un mismo conjunto de datos) que en el REP (escalar el soporte de Bremer con una constante).

Nota lateral: En el paper del 2003, Grant y Kluge cuando discuten el soporte de Bremer no lo relacionan con su definición de soporte tal como parece kedar implícito en el paper del 2007. Hasta donde se, ese enlace fue hecho por primera vez, al menos de forma impresa, por Ramírez (2005) en una replica al paper de Grant y Kluge.

Goloboff, P.A. (1998) NONA/Piwe, programa de computo disponible gratis en: http://www.zmuc.dk/public/phylogeny/Nona-PeeWee/
Goloboff, P.A., Farris, J.S. (2001) Cladistics 17: S26-S34.
Goloboff, P.A. (2007) TNT, programa de computo, demo disponible en: http://www.zmuc.dk/public/phylogeny/TNT/
Grant, T., Kluge, A. G. (2007) Mol. Phyl. Evol. 44: 483-487.
Grant, T., Kluge, A. G. (2003) 19: Cladistics, 379-418.
Ramírez, M. J. (2005) Cladistics 21: 83-89.
Rydin, C., Källersjö, M. (2002) Cladistics 18: 475-513.

martes, noviembre 14, 2006

Secuencias ambientales y monstruos marinos

Hace poco alguien que estaba 'asesorando' a una estudiante en su trabajo de grado, me pregunto si para trabajar secuencias ambientares era necesario hacer un análisis filogenético. El y la estudiante solo querían hacer alineamientos simples usando FASTA.

Sidenote: Las secuencia ambiental es el resultado de amplificar material genético (generalmente ARN ribosomal) con el fin de identificar población bacteriana en sustratos donde es prácticamente imposible aislar bacterias domesticables (i.e. cultivables), como el fondo de los océanos, termales, pozos de desperdicios, pero también en sustratos más tradicionales, como suelos. Estos estudios han detectado una gran variedad de bacterias y archeas nunca vistas (de hecho en muchos casos solo se conocen sus secuencias!) (DeLong & Pace, 2001).

Los alineamientos simples de FASTA son muy poderosos, permiten una identificación rápida y acertada de secuencias conocidas. Un bonito ejemplo es el de Carr (2002), quienes secuenciaron unos misteriosos-y putrefactos-restos encontrados en la costa de Bermudas, su análisis mostró que los restos eran de un cachalote, un monstruo marino-que lo diga Herman Melville ;)-pero nada que excite a un 'cripto-zoólogo'.

Los alineamientos simples de FASTA no son más que claves, automatizadas, muy similares a las hechas por los taxónomos desde los tiempos de Linneo (de eso hablare en otro post), y son muy buenos si las secuencias ya se encuentran en GenBank.

Pero la filogenética es una herramienta mucho más fuerte que FASTA. En primer lugar no se requiere que la secuencia del individuo a identificar no este en GenBank, eso si, se necesita, como en todo análisis filogenético, que existan secuencias de parientes de los individuos en el nivel de resolución deseado. Es ese el aspecto que hace este análisis superior a FASTA: la(s) muestra(s) prueba(s) es(son) colocada(s) en un clado especifico. Los niveles de similitud de FASTA no pueden conseguirlo, pues, como bien saben los cladistas desde tiempos de Hennig, esta similitud no distingue entre similitud por apomorfía o por plesiomorfía. Es posible hacer una identificación partiendo desde niveles filogenéticos amplios e ir mejorando la resolución hacia niveles más restringidos. En el mundo de los cetaceos, ya algunos autores propusieron un protocolo de este estilo para identificar especies de ballenas (Ross & Murugan, 2006), aunque su método se ve afectado porque usan Neighbuor joining (Farris et al., 1996), el espíritu de su procedimiento es como el que defiendo aquí.

La filogenética ya se a usado para hacer identificaciones. Por ejemplo, Allard et al. (1995) demostro que un supuesto ADN de Dinosaurio del mesozoico-a la parque jurasico-era en realidad una contaminación humana. O en un estudio más clásico, (Ou et al., 1992) que había evidencia que un odontólogo contagio a sus pacientes!

Todos estos ejemplos (y si uno se pone a buscar va a encontrar muchos más!) muestran uno de
los puntos más fuertes que tiene el análisis filogenético: y es su asombroso poder predictivo, un punto que, misteriosamente para mi al menos, a sido objetado por alguno que otro de los eminentes 'popperianos' y/o 'realistas escepticos' que escriben sobre la filosofía del análisis filogenético (no los cito, porque de ellos hablare después en otro post). FASTA, aunque muy eficaz, no tiene ese poder predictivo al no poner nunca las secuencias en un contexto filogenético.

Sidenote: Dado que en las secuencias ambientales la expectativa es encontrar cosas desconocidas y nuevas, yo recomendé a mi colega y la estudiante que realizaran el análisis filogenético. Ellos no se veían muy convencidos. Tristemente, aun en estos dias, la gente cree que el análisis filogenético es algo críptico y difícil de comprender :(.

Allard et al. (1995) Science 268: 1192.
Carr, S.M. et al. (2002) Biol. Bull 202: 1-5.
DeLong, E.F., Pace, N.R. (2001) Syst. Biol. 50: 470-478.
Farris, J.S. et al. (1996) Cladistics 12: 99-124.
Ou, C-Y. et al. (1992) Science 256: 1165-1171.
Ross, H.A., Murugan, S. (2006) Mol. Phyl. Evol. 40: 866-871.

lunes, enero 30, 2006

Buenas y malas filogenias

¿Podemos confiar en un análisis filogenético si las relaciones de un grupo se alejan de la expectativa (dada por otros análisis anteriores)?

Seguramente la pregunta no tendría sentido para autores como Kluge. Según sus razonamientos (Kluge 1997, 2003) cada vez conocemos más acerca de la filogenia de un grupo gracias a los 'ciclos de investigación'. Nuestra pregunta implicaría que no hemos usado toda la evidencia disponible para dilucidar las relaciones. Como ejemplo empírico usaría, por ejemplo, Eernisse y Kluge (1993), más recientemente. Pero, el dibujo de Kluge, de adicionar cada vez más evidencia no es tan sencillo. A la hora de planear un análisis filogenético no solo es crucial usar la mayor parte de la evidencia ya usada, sino también hacer una selección cuidadosa de los terminales. Por ejemplo, Giribet et al. (2001) al hacer el análisis filogenético de los artrópodos no utilizó toda la información que el y sus colaboradores han compilado en otros problemas (por ejemplo las relaciones entre los insectos y los quelicerados). Un análisis de esa magnitud, aunque fuera manejable, tendría el problema en que los crustaceos quedarían fuertemente submuestreados.

Pero uno de los resultados más sorprendentes de Giribet et al. es que ¡Drosophila y un dipluro forman parte de los crustaceos! Esto contradice toda expectativa, puesto que la monofilia de los hexápodos es muy bien fundamentada a nivel morfológico y molecular (Wheeler et al. 2001), y las moscas forman claramente un grupo muy anidado dentro de hexápoda. Giribet et al., reconocen las limitaciones de su análisis y no hacen afirmaciones dentro de la filogenia de pancrustacea (aunque aseguran que el grupo esta bine soportado). Es una lastima que Giribet et al. no revisarán que pasaba si se excluía estos taxones problemáticos, aunque en su análisis Drosophila se encuentra dentro de los insectos en el 91% de los costos explorados. De mi experiencia con los datos morfológicos usados por Giribet et al., eliminar Drosophila, Diplura y Balanus (los taxones problemáticos), ambas topologías comparten 11 sinapomorfias (de 12 en los datos completos) para Mandibulata, cuatro (5) para Myriapoda, cinco (7) para Pancrustacea, 6 (8) para Crustacea todas y (7) para Hexapoda, además de que 6 de esos caracteres dejan de ser homoplasicos. Así que para el objetivo de Giribet et al. que es establecer las relaciones entre los grandes grupos de artrópodos ('clases') los resultados son muy acertados. Seria un error que ellos pensaran que su conjunto de datos provee evidencia para contradecir la monofilia de los hexápodos, puesto que el conjunto de la evidencia que ellos examinan se solapa ligeramente ¡con intentos más exhaustivos para esta materia!

De otro lado, otros estudios pueden no ser tan concluyentes. Por ejemplo Silva de Paula et al. (2005) no tienen la precaución de Giribet et al. En un conjunto de datos fuertemente sesgado hacia los triatomineaos (chinches transmisoras de la enfermedad de Chagas) y algunas muestras de sus familiares (chinches reduviidos), llegan a la conclusión que los triatomineos no son monofileticos. La filogenia de los reduviidos no es bien conocida, pero si existe algo esperado en este grupo es la monofilia de los harpactorinos (otros reduviidos) (e.g. Davis 1969, Clayton 1990). Algunas sinapomorfias de este grupo son la membranización del abdomen, una celda cuadrada en el hemielitro, espina tibial y ausencia de glándula vermiforme. Pero en el análisis usado por Silva de Paula, los nueve harpactorinos escogidos parecen divididos en dos grupos de tres terminales cada uno y los otros tres dispersos en otras ramas del análisis. Los únicos grupos reconocidble son Rhondius y Triatomini que constituyen la mayor parte de los terminales del estudio y cuya monofilia queda supuestamente refutada. Silva de Paula et al. simplemente recogieron los taxones disponibles en genbank sin preocuparse por hacer una selección o determinar si la excesiva asimetría del estudio podía sesgar sus resultados. En una exploración preliminar que yo realice usando algunos de esos terminales los resultados dependen según los terminales escogidos.

Ridyn y Källersjö (2002) propusieron un marco de trabajo que consiste en hacer matrices con un contenido diferente de taxones (aunque con los mismos datos). Lo deseable es que los resultados a nivel de los clados encontrados (y uno esperaría también de las sianpomorfias) fueran los mismos a pesar que los terminales son distintos. Un caso de la historia de la ciencia es más o menos claro: gracias a diferentes estudios que usan diferentes conjuntos de taxones, siempre hemos encontrado las relaciones entre los tres 'dominios' de la vida y de los grandes grupos ('reinos') de cada dominio. Casos similares se han visto con los 'filums' de animales y en el ejemplo de Rydin y Källersjö para grandes grupos de plantas vasculares. Esta clase de test podría ser de gran utilidad precisamente para detectar estas instancias de incongruencia entre resultados esperados y los encontrados (en especial cuando la expectativa es fuertemente destruida como en el caso de Giribet et al.). Esta idea es una extensión del trabajo de Siddall y Whiting (1999), si los resultados son productos de ramas largas, ¡pues deben diferir cuando se remueven las ramas largas!

La lección es que la selección de las relaciones filogenéticas no es tan sencilla como Kluge quiere verla. Una investigación simplemente no refuta una anterior, pues en muchos casos la comparación es prácticamente imposible. Existen factores externos al cladograma como tal, como lo son la selección de la evidencia a usar (por ejemplo, si un 'sistema' de caracteres esta solo explorado en un grupo eso puede sesgar el resultado solo hacia ese grupo, y aun sabiendo que esos caracteres están disponibles lo mejor puede ser excluirlos por el momento mientras se recopila información para completar las observaciones en otros taxa) y los terminales que se incluyen en el análisis. Una segunda fuente de decisiones externas constituye el limites en donde aceptamos lo que cladograma expresa, este limite seria preferible delimitarlo antes del análisis (e.g. Rydin y Källersjö 2002), en otras ocasiones es una exploración de los datos (e.g. Giribet et al. 2001) la que nos permite identificar ese limite.

Clayton, R.A. 1990. A phylogenetic analysis of the Reduviidae (Hemiptera: Heteroptera) with redescripotions of the subfamilies and tribes. Ph. D. Dissertation, George Washington University, D.C.
Davis, N.T. 1969. Contributions to the morphology and phylogeny of the Reduvioidea. Part IV. The harpactoroid complex. Ann. Entomol. Soc. Am. 62, 74-94.
Eernisse, D.J., Kluge, A.G. 1993. Taxonomic congruence versus total evidence, and amniote phylogeny inferred from fossils, molecules, and morphology. Mol. Biol. Evol. 19, 1170-1195.
Giribet, G., Edgecombe, G.D., Wheeler, W.C. 2001. Arthropod phylogeny based on eight molecular loci and morphology. Nature 413, 157-161.
Kluge, A.G. 1997. Sophisticated falsification and research cycles: consequences for differential character weighting in phylogenetic systematics. Zool. Scripta 26, 349-360.
Kluge, A.G. 2003. On deduction of species relationships: a précis. Cladistics 19, 233-239.
Rydin, C., Källersjö, M. 2002. Taxon sampling and seed plant phylogeny. Cladistics 18, 485-513.
Siddall, M.E., Whiting, M.F. 1999. Long-branch abstractions. Cladistics 15, 9-24.
Silva de Paula, A., Diotaiuti, L., Schofield, C.J. 2005. Testing the sister-group relationship of the Rhodniini and Triatomini (Insecta: Hemiptera: Reduviidae: Traitominae). Mol. Phyl. Evol. 35, 712-718.
Wheeler, W.C., Whiting, M., Wheeler, Q.D., Carpenter, J.M. 2001. The phylogeny of the extant hexapod orders. Cladistics 17, 113-169.

miércoles, enero 25, 2006

Selección de funciones en cladística

Este post esta basado en mi proyecto de grado, defendido públicamente el 17de enero de 2006. Pueden descargar la presentación y el manuscrito en mi página académica http://ciencias.uis.edu.co/labsist/salvador/relfun.htm. Este proyecto fue dirigido por Daniel Miranda.

Goloboff (1993) desarrollo una alternativa a la parsimonia tradicional (minimizar los pasos homoplasicos), que tiene en cuanta cuan homoplasico es el carácter. Entre más homoplasicos el aumento la distorsión (alejamiento del optimo ideal: no homoplasia) es mucho más pequeño. Es decir que si vamos a escoger entre dos soluciones, se prefiere la que minimize la homoplasia, en los caracteres menos homoplasicos (en vez de minimizarla en todos los caracteres sin importar la homoplasia).

Sin embargo, existen muchas funciones para conseguir esto (en piwe (Goloboff, 1998), tnt (Goloboff et al., 2005) y paup (Swofford, 2001) esta implementada h / (h + k), o su inverso, donde h es la homoplasia del carácter y k una constante de concavidad, entre menor sea el valor de k, mayor sera la fuerza a favor de los caracteres poco homoplasicos. En tnt es posible implementar otras funciones, por ejemplo ln(h), raiz de h, o una con los valores definidos por el usuario). Así que ¿como escogemos las funciones?

La solución usada aquí esta basada en el trabajo de Goloboff (1997) y Ramírez (2003). Consiste en escoger la función que maximize la estabilidad de la topología ante la perturbación de los datos. Las perturbaciones fueron basadas en jackknife: de caracteres, terminales o combinando las dos. También es posible observar la estabilidad revisando solamente el número de nodos muy bien soportados usando búsquedas rápidas (Goloboff & Farris, 2001).

En concordancia con el trabajo de Goloboff (1997), la parsimonia tradicional produjo los resultados menos resueltos y con la menor cantidad de nodos estables. El resultado más interesante para mi, fue que con pocas replicas (20 replicas de eliminación) y sin importar el árbol de referencia usado (uno con búsquedas exhaustivas o usando consensos de Goloboff-Farris), la cantidad nodos estables es la misma que con muchas replicas. Dado ese resultado en el manuscrito se sugirió una búsqueda rápida inicial y luego una búsqueda un poco más exhaustiva para la selección de una sola función.

Goloboff en sus observaciones del manuscrito argumenta que seria mejor explorar la estabilidad de los nodos sin importar el tipo de función usada (similar a la aproximación de Wheeler, 1995 y Giribet, 2003 para datos moleculares).

Creo que es posible tener una solución que tome lo mejor de las dos propuestas. Hacer una búsqueda rápida a lo largo de muchas funciones, y seleccionar el vecindario de funciones optimas, y limitando los resultados de la estabilidad a lo largo de las funciones, solo para los resultados óptimos en el (o los) vecindario(s) de funciones escogido.

Agradezco mucho a P. Goloboff y M. Ramírez que leyeron el manuscrito y proporcionaron muchas ideas y discusión, tanto en su comunicación conmigo, como en sus escritos sobre el tema. D. Miranda dirigió mi proyecto y su ayuda en mi estancia en la universidad es invaluable. El proyecto fue financiado por Colciencias (1102-05-13563).

Giribet, G. 2003. Stability in phylogenetic formulations and its relationships to nodal support. Syst. Biol. 52, 554-564.
Goloboff, P.A. 1993. Estimating character weights during tree search. Cladistics 9, 83-91.
Goloboff, P.A. 1997. Self-weighted optimization: tree searches and character state reconstructions under implied transformation costs. Cladistics 13, 225-245.
Goloboff, P.A. 1998. PiWe/NONA, manual y programa distribuido por el autor. Disponible en internet en http://www.zmuc.dk/public/phylogeny/Nona-PeeWee/
Goloboff, P.A., Farris, J.S. 2001. Methods for quick consensus estimation. Cladistics 17, s26-s34.
Goloboff, P.A., Farris, J.S., Nixon, K.C. 2005. TNT, manual y programa distribuido por los autores. Disponible en internet en http://www.zmuc.dk/public/phylogeny/TNT/
Ramírez, M.J. 2003. The spider subfamily Amaurobioidinae (Aranea, Anyphaenidae): a phylogenetic revision at the generic level. Bull. AMNH 277.
Swofford, D.L. 2001. Paup*, manual y programa distribuido por Sinauer, Sunderland (USA).
Wheeler, W.C. 1995. Sequence alignment, parameter sensitivity, and the phylogenetic analysis of molecular data. Syst Biol. 44, 321-331.

lunes, noviembre 28, 2005

Monofilia, parafilia y polifilia

Ayer presente el examen de calidad de educación superior (ECAES). Allí aparecieron un par de cosas de sistemática. Me refiero más directamente a unos puntos que hablaban de los conceptos básicos de agrupamiento, que a pesar de tener significados precisos, parecen estar rodeados de malentendidos. Voy a ignorar que los conceptos tratados requieren que uno use tanto caracteres como la topología, y me concentro solo en la parte topológica.

Cuando uno se refiere a un grupo monofiletico, este se refiere a que dos terminales (digamos A y B) forman un grupo que excluye a un tercero (por ejemplo C). Yo prefiero que excluya al menos dos taxones, con lo que la posibilidad de rechazar el grupo se hace posible. Pero gracias el tree-thinking parece que se confunde monofilia con nombrar todos los miembros de un nodo y listo. Por ejemplo en el cladograma (A ((B (C D))(E F))) muchos dirían que B y C no forman un grupo monofiletico, pero eso solo es posible si se argumenta que se dejo a D de lado. Si yo digo que B y C son monofileticos con respecto a A y F, la afirmación es plenamente correcta. La definición ‘implícita’ tiene un problema (B y C excluye a D), pues se basa en que uno da una lista completa de los taxa incluidos en el grupo monofiletico.

Ahora bien, decir que D C y E forman un grupo ‘polifiletico’... Primero hay que suponer que se están rechazando a D y F, y en segundo lugar es imposible escoger si un grupo es parafiletico o polifiletico sin referencia a los caracteres (yo sigo a Hennig (1968) y Farris (1991), si lo agrupan por simplesiomorfia es parafiletico, de lo contrario es polifiletico).

Creo que cuando uno habla de grupos, puede hacerlo sin dar a ambigüedad a múltiples interpretaciones, y por desgracia, parece ser que la cladística es confundida como un método para decidir la monofilia de los grupos, olvidando los caracteres.

Farris, J.S. 1991. Hennig defined paraphyly. Cladistics 7, 297-304.
Hennig, W. 1968. Elementos de una sistemática filogenética. Eudeba, Buenos Aires.

lunes, noviembre 21, 2005

Homeostasis

Hace unos días leí dos artículos diferentes publicados en Biology and philosophy con más o menos el mismo tema. Uno es Franz (2005) y el otro es Rieppel (2005). En ambos casos la homeostasis juega un rol central en el análisis cladístico, es decir, se requiere que las tasas de cambio sean lo suficientemente pequeñas para que se pueda realizar la inferencia cladística usando parsimonia.

Rieppel (2005) explícitamente se adhiere a la idea de los ‘grupos naturales’ en un nuevo ataque sobre la diferencia entre ‘grupos naturales’ e ‘individuos históricos’ (v.g. Keller et al., 2003) que tiene pocos efectos sobre el actuar y el entendimiento de la practica cladística (claramente expresado en Pleijel & Härlin, 2004). Franz (2005) no es tan explícito, pues desea dar una explicación ‘naturalista’*. Es clave en la nueva concepción de los grupos naturales la homeostasis, que es lo que deseo discutir en este post. El otro punto común del análisis de los dos autores son los aspectos lingüísticos que dejare de un lado (durante toda mi vida, espero).

Así, dado que los clados son ‘grupos naturales’ (no confundir con grupos monofileticos**) están unidos por un sistema homeostatico (no por esencias), así que aunque evolucionan con el tiempo, poseen características que los hace reconocibles como miembros de un mismo ‘grupo natural’, pero estas características deben descubrirse y son sujetas a modificación. No niego la cuestión epistemológica, el problema es que los sistemas homeostaticos son sistemas en equilibrio y requieren asunciones particulares sobre la evolución. Rieppel arguye por un mecanismo homeostatico que incluye la ontogenia para mantener ‘islas en el morfoespacio’. Para Franz la homeostasis permite que ciertos sistemas de caracteres, los que evolucionan más despacio, sean los preferidos por los cladistas (y los taxonomos en general).

En base a esto, la homeostasis es el motivo por el cual se utiliza parsimonia como test simultaneo de caracteres. El salto es automático en Rieppel, mientras que Franz arguye que como la parsimonia requiere tasas bajas de cambio, los cladistas la usan para sus sistemas de caracteres que por definición solo tomaron los que evolucionaban más despacio. Es curioso que 50 años después de Hennig justo hasta ahora aparezca el asunto de la homeostasis, y más aun, luego de las constantes batallas argumentando que parsimonia NO requiere tasas bajas de cambio (vg. Farris, 1983; Källersjö et al., 1999). El argumento de la homeostasis parece más adecuado para dar soporte a métodos estadísticos con modelos explícitos de homeostasis. De hecho Franz no parece incomodo con los métodos como máxima verosimilitud (likelihood) y parece que el único motivo por el cual prefiere parsimonia es porque las descripciones de parsimonia son más acordes con la practica taxonómica. Rieppel no menciona nada sobre verosimilitud, pero sus ‘islas en el morfoespacio’ que dan coherencia a un clado parecen implicar ese mecanismo supraespecifico.

Creo que los mecanismos homeostaticos deben ser muy interesantes para quienes hacen biología del desarrollo, pero no les veo mucha aplicación en el análisis cladístico. Las inferencias de homología hechas por los cladistas aunque toman en cuenta información proveniente de la biología del desarrollo (véase Rieppel & Kearney, 2002), también la rechazan (el ejemplo claro, la homología de los dedos de dinosaurios theropodos y aves). En general, el rechazo de una filogenia solo se da cuando hay otra que la reemplace eficientemente, así sea contradictoria con todas las investigaciones provenientes de la biología del desarrollo.

Por otro lado, cuando se trata inferir homología, los cladistas se preocupan por determinar si dicha característica es la misma en diferentes taxones, la tasa de cambio no es relevante. En el caso en que la estructura este tan radicalmente modificada que no se pueda reconocer como la misma estructura (el caso de la ‘homología molecular’ de los ojos de vertebrados y artrópodos) la característica no puede ser descubierta, pero el efecto es igualmente pernicioso para los métodos de verosimilitud, puesto que si no hay estructuras definidas como parte del mismo sistema de caracteres ¿como se les puede asignar un modelo?

Franz puede argüir a favor de la homeostasis con cualquier evidencia (como queda claro con su ejemplo de los primers). En los sistemas de caracteres, creo que el problema no esta en la homeostasis de estos, sino hasta donde podemos excavar con ellos. Como toda ciencia histórica, la filogenética (en general, no solo la cladística) tiene problemas para encontrar evidencia confiable a medida que el tiempo del evento es más lejano en el pasado y habrá problemas que quizás nunca podamos resolver. Pero los motivos para la selección de la evidencia no están basados en como el carácter a evolucionado (homeostasis del carácter), sino en que en realidad se trata del mismo carácter en diferentes taxa, la motivación esta ahí desde los trabajos de Darwin y Mendel: características heredables.

*Para los que les interesan los asuntos sociológicos, Franz pertenece al mismo laboratorio donde trabajaron se elaboro el manuscrito de Keller et al.(2003), en el que también participa Boyd. Es una coincidencia espectacular que el análisis naturalista de Franz coincida con la posición filosófica de su laboratorio, es decir los grupos naturales del tipo descrito por Boyd y desarrollado por Rieppel (que también esta en los agradecimientos de Franz).
**Para Rieppel y Franz, es posible que los términos sean intercambiables. Sin embargo, grupo monofiletico esta relativamente más libre de lastre filosófico que ‘grupo natural’, por lo que cuando uno dice grupo monofiletico no implica que uno se refiera a estos como un ‘grupo natural’.

Farris, J. S. 1983. The logical basis of phylogenetic analysis. In: Platnick, N. I., Funk, V. A. (eds). Advances in cladistics, vol. 2. Columbia Univ., New York.
Franz. N. 2005. Outline of an explanatory account of cladistic practice. Biol. Phil. 20, 489-515.
Källersjö, M., Albert, V. A., Farris, J. S. 1999. Homoplasy increases phylogenetic structure. Cladistics 15, 91-93.
Keller, R. A., Boyd, R. N., Wheeler, Q. D. 2003. The illogical basis of phylogenetic nomeclature. Bot. Rev. 69, 93-110.
Pleijel, F. Härlin, M. 2004. Phylogenetic nomeclature is compatible with diverse philosophical perspectives. Zool. Scripta 33, 587-591.
Rieppel, O. 2005. Monophyly, paraphyly, and natural kinds. Biol. Phil. 20, 465-487.
Rieppel, O., Kearney, M. 2002. Similarity. Biol. J. Linn. Soc. 75, 59-82.

jueves, noviembre 17, 2005

Sinapomorfia y Popper

El otro día en la lista de correo del e-grupo “clado” (en ar.yahoo.com) se discutió un poco sobre Popper y la sistemática, así que tras presentar una parte de mi posición a los miembros del grupo, coloco algo un poco más largo aquí... espero que la cosa no este muy confusa!

*****

El poder del análisis cladístico esta en la asignación de estados de carácter óptimos en los nodos. Un cladograma solo tiene sentido a la luz de transformaciones de caracteres (sinapomorpfias). Esta idea esta basada en el principio auxiliar de Hennig, las sinapomorfias son evidencia de agrupamiento:

“It must be recognized as a principle of inquiry for the practice of systematics that agreement in characters must be interpreted as synapomorphy as long as there are no grounds for suspecting its origin to be symplesiomorphy or convergence.” (Hennig, 1965, p. 104).

Y un grupo solo puede sostenerse en presencia de sinapomorfias:

“The supposition that two or more species are more closely related to one another than to any other species, and that, together form a monophyletic group, can only be confirmed by demonstrating their common possession of derivative characters (”synapomorphy”).” (Hennig, 1965, p. 104).

Esta idea es contradictoria con la idea de Popper de la evidencia. Las sinapomorfias son evidencia positiva con las que se escoge un grupo monofiletico (y en consecuencia el cladograma). Kluge parece estar consiente de este problema y trata de cambiar el resultado. El arguye que la selección de cladogramas es:

“a logical consequence of any h being part of a closed hypothesis set, where falsification applies symetrically” (Kluge, 2003, p. 236).

Con ese movimiento Kluge remueve una de las características más importantes de la metodología de Popper. El poder de la falsación radica en su asimetría (véase por ejemplo Popper, 1983, sec. 22). Bajo la asimetría falsacionista la evidencia esta en contra de una hipótesis pero la evidencia positiva no dice nada acerca de la hipótesis excepto en la parte trivial: el resultado es compatible con la hipótesis. De lo contrario, con una perspectiva simétrica falsación y verificación son equivalentes:

“a [synapomorphy], that counts against a particular h, such as (A,B), must count equally for one of the alternatives, such as (A,C) or (B,C).” (Kluge, 2003, p. 237, italicas en el original).

Si dejamos que falsación y verifiación sean equivalentes, es extraña la acusación de ‘verificacionismo’ que Kluge adjudica a los métodos que rechaza (v.g. Kluge, 1997a, 1997b, 2001; Siddall & Kluge, 1997; Grant & Kluge, 2003).

En la literatura existen posiciones verdaderamente Popperianas:

“The relationship between characters and genealogies thus shows a kind of asymmetry. Genealogy ((A,B),C) requires that B+C characters be homoplasious, but requires nothing at all concerning the A+B characters.” (Farris, 1983, p. 13)

La posición de Farris mantiene el ingrediente asimétrico de la metodología de Popper: mientras la homoplasia cuenta en contra de la filogenia, las sinapomorfias son silenciosas*. Sin embargo, esa concepción es contradicha por la practica cladística: desde Hennig hasta hoy los grupos monofileticos son reconocidos por sus apomorfias. Escribir, decir, o dibujar un grupo soportado por transformaciones implica un compromiso con esos caracteres como evidencia de un grupo. Es decir, los cladistas son realistas con respecto a las sinapomorfias.**

Por ejemplo, hasta hace poco las plumas eran una sinapomorfia de las aves, pero unos fósiles chinos mostraban que linajes no-avianos de dinosaurios tenían filamentos que se interpretaron como proto-plumas. Esto implica que otros linajes más cercanos a las aves, también tuvieron plumas (o proto-plumas) si uno esta comprometido con las plumas como sinapomorfia. De lo contrario, si uno no es realista con respecto a las plumas, entonces no hay ninguna implicación, pues las plumas pueden o no ser una sinapomorfia.

De otro lado, quienes usan likelihood, o análisis bayesiano siguen exactamente la sugerencia de Farris (1983) y Kluge (1999, 2003). Las topologías solo implican homoplasia, pero no implican que un carácter optimado como sinapomorfia sea una sinapomorfia. Por ejemplo, bajo likelihood (0 (0 (1 1))) es optimado como 0-0-1 o 0-0-0, no hay compromiso con 1 como sinapomorfia.

* El argumento de Kluge (2003) es contradictorio. En una parte (p. 237) acoge la simetría de forma explicita, y en otra usa el mismo ejemplo y cita este pasaje de Farris (p. 236), que es claramente asimetrico.
** Ser realista con respecto a las sinapomorfias no implica que se consideren una verdad ultima y absoluta, más bien, se asume que estas existen hasta no encontrar prueba de lo contrario (c.f. Hennig, 1965, 1968).

Farris, J. S. 1983. The logical basis of phylogenetic systematics. In: Advances in cladistics, vol. 2 (Platnik, N.I., Funk, V. A., eds.). Columbia Univ., New York. Pp. 7-36.
Grant, T., Kluge, A. G. 2003. Data exploration in phylogenetic inference: scientific, heuristic, or neither. Cladistics 19, 379-418.
Hennig, W. 1965. Phylogenetic systematics. Annu. Rev. Entomol. 10, 97-116.
Hennig, W. 1968. Elementos de una sistemática filogenética. Eudeba, Buenos Aires.
Kluge, A. G. 1997a. Sophisticated falsification and the research cycles: consequences for differential character weighting in phylogenetic systematics. Zool. Scripta 26, 349-360.
Kluge, A. G. 1997b. Testability and the refutation and corroboration of cladistic hypotheses. Cladistics 13, 81-96.
Kluge, A. G. 1999. The science of phylogenetic systematics: explanation, prediction, and test. Cladistics 15, 429-436.
Kluge, A. G. 2002.Distinguishing “or” from “and”, and the case for historical identification. Cladistics 18, 585-593.
Kluge, A. G. 2003. On the deduction of species relationships: a précis. Cladistics 19, 233-239.
Popper, K. R. 1983. Realism and the aim of science. Routledge.
Siddall, M. E., Kluge, A. G. 1997. Probabilism and phylogenetic inference. Cladistics 13, 313-336.