Mostrando las entradas con la etiqueta taxonomía digital. Mostrar todas las entradas
Mostrando las entradas con la etiqueta taxonomía digital. Mostrar todas las entradas

sábado, noviembre 27, 2010

IX Reunión Argentina de Cladística y Biogeografía, La Plata (15-17 nov 2010)

Hace unos días termino la IX Reunión Argentina de Cladística y Biogeografía, hubiera querido hacer un poco de live-blogging, pero pues estuve mucho con la gente (lo cual, aunque "malo" para el blog, es bueno para mi xD), "hablando" hasta tarde, y comentando de todo :). De todas, maneras, así sea con unos días de más, esta es mi impresión de la reunión (al menos, en su parte académica! xD).

En general mucha gente, se que fueron alrededor de 150 personas, aparte de muchas conferencias, hubo un montón de posters ;). En general, pues apenitas si medio ojeé los posters (eran muuchos!), y uno prefiere usar el coffee break para hablar por ahí :P. Las charlas, en cambió, las vi casi todas ;), y es de lo que voy a hablar. Me refiero en singular a los oradores, aunque muchos de sus trabajos fueron trabajos colaborativos!

Lunes, 15 nov

La inauguración corrió por cuenta de las autoridades universitarias y del museo, y pues del comité organizador, con la conferencia de apertura de Jorge Crisci, una de las figuras más importantes del museo de La Plata. Era sobre algunas de las ideas de Darwin sobre evolución, y como el componente biogeográfico jugo un factor importante en la elaboración de sus ideas.

Más tarde Gonzalo Giribet hablo sobre las nuevas formas de adquirir datos moleculares, y como esa fuente masiva de datos a impactado nuestro conocimiento de la filogenia de Metazoa. Más tarde Martín Ramírez presento como va progresando el portal de datos de biodiversidad de Argentina. Una de las cosas que me gusta de la posición de Martín es como el ve las colecciones como un patrimonio del estado, y como el hacer publico los datos puede ser benéfico!

En la tarde fue el simposio de Biogeografía, que organizo Sergio Roig. La primera parte fue sobre filogeografía, donde Agustina Ojeda hablo de unos pequeños roedores cavernicolas de Mendoza. S. Poljack estudió unos armadillos argentinos conocidos como peludos, mientras M. Ferrer estudio la relación entre un gorgojo y una planta que parasita al algarrobo.

Después vinieron un par de charlas que por algún misterioso motivo, Sergio etiqueto como "clásicas", la mía no estaba ahí pero pues yo creo que lo que hago es herencia directa de Hennig y Brundin ;), supongo que eso es lo "clásico"? Juan Morrone habló de las "zonas de transición"que el ha trabajado: los andes y las sierras madre de México. Luego Paula Posadas mostró un trabajo bibliográfico sobre Journal of Biogeography y como en los últimos años, el número de papers de filogeografía a incrementado notablemente.

Martes, 16 nov

Llegue un poco tarde... así que me perdí la charla de Amelia :P. Luego Ignacio Escapa presento un laburo del que yo sabía un poco por Santiago Catalano, el co-autor, era sobre la araucarias y pues realizaron varios experimentos muy interesantes :D. Justo después, Marcos Mirande, que también labura en el lillo, y por ello más o menos sabía de que era también, presento una continuación de su trabajo con characidae, esta vez enfocado en un grupo particularmente modificado. Anyelo Vanegas, otro colombiano que labura también con Marcos, mostró los avances en otra parte de la rama de esta familia particularmente diversa de peces. Al final de la sesión, M. Alberdi (creo) habló sobre la biogeografía de los “elefantes” que vivieron en suramerica durante el Pleistoceno.

En la segunda sesión de la mañana Lone Aagesen estuvo hablando sobre los endemismos del área de las yungas y al zona nor-este de Argentina, así como la relación de esos endemismos para vegetales y las condiciones climatológicas. Luego Luis Acosta mostró como diferentes modelos climaticos pueden dar ideas muy diferentes en organismos con muestreo intensivo (unas especies de opiliones) y como es posible relacionar esos resultados con el laburo de campo. Tania Escalante hablo sobre las áreas de endemismo de algunos roedores norteamericanos y como se relacionan las áreas de endemismo y las distribuciones modeladas. Facundo Labarque contó su experiencia y resultados con un inventario de arañas de Panamá, yo había visto a Facu dar una charla más detallada hace poco, fue un tremendo esfuerzo eso, y Martín Ramírez en una conferencia bien particular nos contó acerca de como se desarrollo el laburo, específicamente, sobre el costo humano de ese proyecto.

Por la tarde, Miquel Arnedo redondeo una reunión con un enorme componente filogeográfico, con una revisión y muchos ejemplos de su laburo con arañas. Yo nunca he sido muy fan de la "filogeografía", pero siempre me ha gustado el trabajo de Miquel, me parece a la vez bien abarcativo, y a la vez como bien enfocado en una cuestión. Despues vino como la primera sesión del simposio de trabajos empíricos (organizado por Adriana Marvaldi) pero yo me sentía muy cansado, así que preste poca atención :P.

Al final de la tarde, Gonzalo hablo esta vez de los Opiliones y de su filogenia y biogeografía y como el a usado a estos arachnidos para contrastar o corroborar varias hipótesis biogeográficas. Luego Diego Pol hablo sobre nuevos dinos que se han encontrado en patagonia, y sobre la importancia particular de esos fosiles en la filogenia y biogegrafia de los dinosaurios (en especial, su implicación en nuestra comprensión en la ruptura de Pangea). Al final Adriana Marvaldi, hablo, como no xD, de la filogenía de los Curculionidos, de las coincidencias y diferencias entre la evidencia molecular y mofológica y los prospectos futuros en estos insectos.

Para finalizar el día, fue la "primera reunión" de la sociedad Argentina de taxonomía y sistemática, donde se discutió sobre las cosas que vienen, y lo que se ha hecho.

Esa noche fue la cena del congreso, y pues la charla corrió a cargo de Santí y Nacho, con una aparición especial de Marcos xD... Fue una charla muy graciosa ;).. bien hecho! :D!

Miercoles 17 nov

El día después de la fiesta llegue tarde (de nuevo xD) a las charlas de la mañana. No solo fue la trasnochada de la noche anterior :P, jejeje, también tenía que hacer el check-out y eso siempre me pone todo azarado :P... Lastima me perdí una charla sobre chinches que quería ver :(

V. Pereyra (creo) hablo sobre las relaciones filogenéticas en los Entiminae, un grupo muy diverso de gorgojos. Pablo Goloboff, dio una de las charlas más importantes (a nivel metodológico) sobre nuevas estrategias en el uso de pesos implicados que fueron implementadas en TNT hace poco menos de un mes. Claudia Szumik presento una de las charlas empíricas que más me gusto, sobre varios caracteres nuevos para las relaciones de los Embiopteros (su laburo de toda la vida :D), y sobre potenciales fuentes de aún más información. Mariano Donato hablo sobre los efectos de utilizar caracteres continuos es un grupo de Chironomidos. Amelia Chemisquy mostró potenciales efectos en las medidas de apoyo que se deben más que todo al tamaño de los grupos (más que al apoyo en sí).

En la tarde, la charla plenaria era de Maria Cigliano, quien mostró la increíble experiencia del Orthoptera file online, un enorme esfuerzo de los taxónomos de ortópteros, y se me hace un trabajo ejemplar en lo que tiene que ver con “cyber-taxonomía”. (En realidad, yo no vi la charla, pero vi una presentación preliminar hace unos meses ;) ejejeje).

El simposio de metodología (organizado por Pablo) cerro la reunión, D. Gutson hablo sobre un método estadístico para evaluar la potencial posición geográfica de los virus en una filogenia. A decir verdad, no estoy muy seguro de la justificación de su método. Juliana Sterli, hizo una excelente presentación sobre los diferentes efectos de los relojes moleculares, en particular, ella uso las tortugas y pues creo, hizo el test que yo siempre había deseado ver: que tanto se parece lo que se estima, con lo que se sabe en cuanto a relojes moleculares? En este simposio también hable yo, de lo de siempre, así que no hay mucho que agregar ;). Luego Santiago Catalano, mostró nuevas ideas sobre como la optimización de landmarks, y de como atacar específicamente el problema del alineamiento de los landmarks (gran charla!). Pablo, en su segunda charla del día, hablo esta vez sobre el efecto de los análisis con super-matrices y de como ciertos nuevas metodologías de "búsqueda" (basadas en búscar menos :P) pueden ser terriblemente afectadas! Para terminar Ignacio, dió su segunda charla de la reunión, esta vez sobre la identificación y efecto de los terminales inestables en el apoyo. Una cosa super-interesante, pues que a pesar de sonar super-evidente, creo nunca ha hecho un examen explicito de la relación directa entre taxones estables y apoyo, y por lo tanto, como se afecta la estabilidad a nivel de árboles suboptimos.

Una muy buena reunión, con muchas ideas interesantes, y pues me alegra ver como la comunidad de la gente que hace filogenia, y taxonomía, tiene un gran grupo dentro de Argentina, y que hay interés y continuidad en todos los niveles académicos :)!

Ahora a esperar otoño del 2012 en Mendoza ;)!

sábado, diciembre 22, 2007

Bases de datos relacionales para datos filogenéticos

Hoy es un día de traducciones ;). Este post es la versión en español de mi post previo en 'ingles' sobre el tema.

Hace un buen tiempo cuando estudiaba ingeniería de sistemas (=ciencias de los computadores), el paradigma reinante para las bases de datos eran las bases de datos relacionales, pero con el rápido crecimiento de internet, computadores más poderosas, y motores de búsqueda eficaces y populares--como Google--pusieron las bases de datos basadas en texto en la cima. Las bases de datos basadas en texto son el paradigma en el cual se han desarrollado las bases de datos para datos filogenéticos, como GenBank y TreeBASE.

En las bases de datos basadas en texto (BDTex) el énfasis se coloca en estandarizar los archivos de entrada, que deben contener todos los datos necesarios para hacer una búsqueda. Seguramente el lector conoce los archivos que se pueden descargar de GenBank, o las matrices/árboles descargados desde TreeBASE. Ellos tienen muchos campos, como una clasificación, identificación de las secuencias o caracteres, un algoritmo de string matching (coincidencia de letras/palabras? No se como se diga esto en español :P) es usado para encontrar coincidencias exactas o similares a la solicitud del usuario.

Entonces, la principal fuente de investigaciones para las BDTex esta basada en los algoritmos de string matching. El blog iPhylo de Rod Page, tiene varios posts, y enlaces a artículos y manuscritos (aquí o aquí) sobre el tema. Pero yo creo que las bases de BDTex son una aproximación erronea.

La coincidencia de letras (string matching) es una buena herramienta para buscar palabras claves a lo largo de la red, o varios grupos de letras, como la búsqueda de secuencias en GenBank (yo supongo que esa es la principal razón para que sea una BDTex!), pero parece problemática para una base de datos de taxonomía/filogenia. Quiero resaltar algunos puntos:
  • Ambigüedad: aunque la entrada para cargar archivos en los servidores estén basados en plantillas de 'cortar y pager' (o usen asistentes paso a paso), es responsabilidad de quien carga el archivo llenarlo adecuadamente. Como Page llama la atención, en muchas de las matrices de TreeBASE los nombres de los terminales no son nombres científicos.
  • Información irrelevante: cuando uno descarga un archivo, este suele estar lleno de información que el usuario no desea, y otra información no esta disponible. Además como las búsquedas se basan en coincidencias de texto, cosas como notas, comentarios y otros campos pueden confundir a los algoritmos (recuerden, se trata de algoritmos de string matching!).
  • Formateado: Al ser una base de datos basada en texto, se tiene que hacer un compromiso en hacer los archivos legibles (=estandarizados) por varios programas lo que hace que los campos sean rigidos y existe una gran dificultad para incluir nuevos campos e información. Por ejemplo, la información geográfica en GenBank no es obligatoria--hasta donde se--incluso para los conjuntos de datos usados en análisis filogeográficos! La información geográfica y de material examinado para TreeBASE parece imposible si su implementación continua unida al formato nexus.
  • Taxonomía: Como consecuencia del formateado rígido, clasificaciones alternativas y búsquedas usando sinónimos no pueden ser implementadas, o requieren búsquedas adicionales en bases de datos alternativas.
  • Filogenia: ¿Alguna vez han intentado buscar una 'estructura de árbol' en TreeBASE?
Las bases de datos relacionales son un concepto diferente a las BDTex. Se basan en usar muchas tablas independientes conectadas mediante campos-clave (keys) muchas veces usando tablas secundarias para enlazar diferentes tablas. El motor de búsqueda esta basado en explorar las claves específicas (en búsquedas complejas) y campos específicos dentro de cada tabla.
Mi propia idea de como debe ser la estructura de la base de datos, en forma simplificada, y basada en mis propios intereses y búsquedas que yo he realizado es esta:
Por supuesto, un diseño adecuado requiere muchos años de desarrollo, con montones de entrevistas a varios taxónomos para permitir un producto que pueda ser usado adecuadamente alrededor del mundo! (A pesar que en sus post el apoya las BDTex, este post de Rod Page da varias ideas muy interesantes sobre el trabajo multidisciplinario de una base de datos para filogenias, por supuesto hay muchas cosas en la que yo no estoy de acuerdo xD).

Esta es la descripción de las diferentes tablas de mi bosquejo. La tabla 'taxon' guarda la nomeclatura del nombre actual de un taxon, sea una especie o una entidad supra-especifica, puede incluir la diagnosis (enlazada con la tabla de entrada de caracteres!), el 'concepto filogenético', enlace a dibujos o fotografías, el espécimen tipo (con enlace a la tabla de especímenes) y cosas de ese estilo. La tabla de 'synonyms' y 'classification' son tablas secundarias que guardan solo la relación entre dos taxones: los sinónimos (se puede incluir el motivo de la sinonimia), y el siguiente taxon más inclusivo de un taxon particular (y puede incluir el autor de esa propuesta de inclusión). Como cada taxon es tratado de forma independiente uno puede incluir tantos sinónimos como desee, o múltiples clasificaciones propuestas.

La tabla 'specimen' puede guardar información especifica de el material examinado, enlace a fotografías del espécimen, la localidad donde fue colectado, y cosas así.

Además hay una sección de caracteres! La tabla 'character' guarda el nombre, descripción, y quizá una bibliografía y dibujos o fotos del carácter, con 'character equivalences' es posible guardar caracteres equivalentes usados en otros estudios, permitiendo referencias cruzadas entre estudios que tengan diferentes grupos de terminales, la tabla 'character entry' guarda la información especifica de un carácter y un taxon, puede ser una celda de una matriz de caracteres morfológicos, o un fragmento específico de una secuencia molecular.

Este diseño puede ayudar en las cosas en donde las BDTex fallan. La ambigüedad es reducida, porque cada entrada es única y especifica: al cargar un archivo en la base de datos se debe identificar la naturaleza especifica de la entrada. BDTex pueden desarrollarse con un estándar como ese, pero en este caso es posible incluir muchos sinónimos, y nombres específicos de caracteres. Un proceso curatorial para la taxonomía puede ser posible sin destruir la integridad del conjunto de datos, y como los resultados filogenéticos deben ser introducidos en forma de una clasificación, el distanciamiento entre la filogenia y la clasificación [1] se vera reducido.

Cuando se realiza una búsqueda el usuario puede recuperar solo la información específica que desea: por ejemplo todos los caracteres para la cabeza de Hymenoptera, usando las equivalencias los caracteres pueden ser organizados en una forma relativamente adecuada, y usando la tabla de clasificaciones es posible encontrar caracteres de la cabeza usados en diferentes estudios, caracteres que pueden estar incluidos si se utiliza una clasificación alternativa, o caracteres que pueden estar presentes al ser incluidos en clasificaciones más inclusivas (por ejemplo, caracteres usados para definir Hexapoda o Arthropoda), de esta forma se consigue un verdadero sistema de recuperación de la información basado en la clasificación [2].

Tal y como muestran Nixon et al. [3] un único formato de archivo no es algo bueno para una base de datos, más bien, es preferible la estructura de tablas, y mecanismos de reporte que puedan producir entradas en diferentes formatos, por ejemplo recuperar secuencias en el formato de GenBank, en el de TNT, y en POY (fasta), o un archivo de distribuciones listo para usar con NDM.

La tabla de clasificaciones puede ayudar para localizar estudios que apoyen o rechacen una clasificación particular, el usuario puede encontrar la evidencia para un agrupamiento y para la clasificación alternativa. Pueden desarrollarse y usarse algoritmos que realicen la tarea de convertir la estructura de un árbol en una solicitud de búsqueda--Page a posteado sobre el tema con relativa frecuencia ;)--. Pero es más poderoso que las busquedas basadas en texto pues la misma base de datos posee la información (la clasificación jerárquica) para realizar la búsqueda.

Espero algún día hacerme millonario (lo dudo :P) o recibir financiación--ojala ;)--para elaborar esta enorme tarea, o al menos que alguien en la red, tenga ideas similares. Hasta entonces el único camino parece ser el sufrimiento continuo con las bases de datos 'taxonómicas' y 'filogenéticas' que esta por la red...

Pd. Como se puede ver, quizá esta base de datos pondria más cosas sobre el investigador que cargue los datos... pero despues de haber estado en campo por meses, examinar material por horas, día tras día, escribir reportes y manuscritos, cargar la información es solo una parte de toda la investigación!

[1] Franz, N.M. 2005. On the lack of good scientific reasons for the growing phylogeny/classification gap. Cladistics 21: 495-500.
[2] Farris, J.S. 1979. The information content of the phylogenetic system. Systematic zoology 28: 483-519.
[3] Nixon, K.C., Carpenter, J.M., Borgardt, S.J. 2001. Beyond NEXUS: universal cladistic data objects. Cladistics 17: S53-S59.