3. MATERIAL Y MÉTODOS
3.9 Estudio transcriptómico mediante hibridación de Micromatriz de DNA
3.9.1. Diseño experimental
Anteriormente a que se iniciara este trabajo de tesis y dentro del proyecto
transcriptomic, metabolomic and reverse genetic approaches” (MELRIP), incluido en el
programa ERA-PG, se desarrolló un nueva micromatriz con la tecnología NimbleGen, a partir del desarrollado previamente por Mascarell-Creus et al. (2009). A ésta se le añadieron 242 unigenes: 33 obtenidos a partir de la base de datos del NCBI (“The
National Center for Biotechnology Information database”) y 209 ESTs de ICuGI
(http://www.icugi.org/). Finalmente, el nuevo chip contenía un total de 17,443 unigenes con una longitud de 60 nucleotidos (60 mers), representados cuatro veces (70K). Se hibridaron muestras de cDNA de pulpa de tres réplicas biológicas provenientes de genotipos con maduración climatérica y no climatérica para proceder al análisis transcriptómico, en cuatro estadios diferentes del desarrollo del fruto, previamente seleccionados tras estudios metabolómicos realizados en el “Max Planck Institut of
Molecular Plant Physiology” (MPIMP, Gölm). Uno de los genotipos climatéricos
utilizados, además de las variedades climatéricas Dulce y Vèdrantais, fue la línea climatérica SC3-5-1. Como genotipos no climatéricos se utilizaron los parentales de nuestra línea “Piel de Sapo” (PS) y “Songwan Charmi” (PI) (Fig. 3.2).
Figura 3.2.Genotipos climatéricos (Dulce, Vèdrantais y SC3-5-1) y no climatéricos (PS y PI) a distintos tiempos de desarrollo del
fruto utilizados en el estudio transcriptómico mediante el uso de la micromatriz de melón. (Saladie et al. manuscrito en preparación).
15 DAP 25 DAP 35 DAP HARVEST
D U LC E V ED PS P I SC 3 -5 -1
3.9.2. Normalización y análisis de los datos
Para el análisis y normalización de los datos crudos procedentes de las hibridaciones se colaboró con el Dr. Lohse del "Max Plant Institute for Molecular Plant
Physiology" (MPIMP); donde se han ha desarrollado herramientas para el análisis y la
normalización de datos provenientes de micromatrices. Una de esas herramientas ROBIN (Lohse et al. 2010) permite además de normalizar esos datos, conocer la calidad técnica y estructura de los mismos mediante varios métodos estadísticos. ROBIN es un software libre basado en el lenguaje de programación R-Bioconductor (Gentleman et al. 2004), que incluye una serie de paquetes y librerías como LIMMA (Smyth G. 2004) que permiten la normalización de datos de micromatrices.
Después del escaneo de los “spots” para cada muestra o chip (Tabla 3.1) se procedió a un primer análisis visual de las hibridaciones con el fin de identificar la presencia de posibles burbujas, arañazos o diferencias de señal localizadas en determinados puntos del array; en este paso se excluyó la muestra PS-18a (15 DAP) del estudio al no cumplir los estándares de calidad. Posteriormente se seleccionaron los triplicados restantes para ser normalizados mediante el uso de ROBIN; previamente en el MPIMP se adaptó el script a las características físicas del array desarrollado por NimbleGene. La normalización de los datos se llevo a cabo con el paquete LIMMA (“Linear Models in Microarrays”) del software Bioconductor (Gentleman et al. 2004). Los datos fueron normalizados para compensar las posibles diferencias en el marcaje de las muestras y otras fuentes de variabilidad no biológicas.
Tabla 3.1. Listado de muestras de cada uno de los genotipos (Dulce, Vèdrantais, SC3-5-1, PS y SC) a distintos tiempos de desarrollo del fruto (15, 25, 35 DAP y punto de cosecha o harvest) hibridadas en la micromatriz de melón.
Genotipo 15 DAP 25 DAP 35 DAP Harvest
Dulce-4a_15d Dulce13a_25d Dulce-5a_35d Dulce-18a_50d
Dulce Dulce-16a_15d Dulce-21a_25d Dulce-9a_35d Dulce-18b_50d
Dulce-26a_15d Dulce-32a_25d Dulce-29a_35d Dulce-34a_50d
VED-12a_15d VED-23b_25d VED-3a_35d VED-8a_45d
Vedrantais VED-19a_15d VED-26a_25d VED-11a_35d VED-12a_45d
VED-27a_15d VED-26b_25d VED-20a_35d VED-19a_45d
SC3-5-1-16a_15d SC3-5-1--19a_25d SC3-5-1-1a_35d SC3-5-1-J4a_45d SC3-5-1 SC3-5-1-16b_15d SC3-5-1-12a_25d SC3-5-1-6a_35d SC3-5-1-28a_45d SC3-5-1-4a_15d SC3-5-1-22a_25d SC3-5-1-18a_35d SC3-5-1-37a_45d
PS-1a_15d PS-S1_25d PS-29a_35d PS-37a_55d
PS PS-18a_15d PS-S2_25d PS-23a_35d PS-E1a_55d
PS-16a_15d PS-3a_25d PS-9a_35d PS-36a_55d
SC-1b_15d SC-JP2a_25d SC-33a_25d SC-9a_50d
SC SC-23a_15d SC-JP2b_25d SC-6a_35d SC-10a_50d
La intensidades de los spots provenientes de los escaneados fueron calculadas y normalizadas usando el método de “Robust Multichip Average” (RMA) (Irizarry et al. 2003).
La calidad de los datos fue estudiada para cada chip comparando la distribución de la señal de cada uno de ellos con una distribución teórica calculada a partir de la mediana de expresión de todos los chips. Estos gráficos MA representan el log2 del “fold change” de la expresión (M) frente a la media del log2 de la intensidad de la señal (A). Además ROBIN ofrece dos medidas más de la calidad: (1) el porcentaje de genes que presentan un “fold change” superior a 2 (%>LCFI) y (2) la integral de los valores absolutos obtenidos de la línea ajustada mediante regresiones pesadas localmente lineales (LOWESS, “locally weighted scatter plot smooth”) a los valores de intensidad (I). Cuando en uno de los chips el número de genes que presentan un “fold
change” es mayor al 5 % o los valores de I>1.5, el programa nos advierte de que
podemos estar ante un problema relacionado con efectos de artefactos sobre la intensidad de la señal. Aquellos chips en los que se excedían ambas medidas fueron excluidos del análisis (Apéndice A.11).
Los datos generados en un experimento de micromatriz de DNA pueden ser entendidos como una matriz de p columnas, donde p es el número de chips del experimento, y n filas, donde n es el número de genes del “array”. Por lo que el conjunto de los datos puede ser visualizado como un conjunto de n puntos en un espacio p-dimensional. El análisis de componentes principales (PCA) reduce la dimensionalidad de un conjunto de datos encontrando un número pequeño de combinaciones llamados componentes principales que explican la mayor parte de la varianza observada y nos permiten comparar las replicas utilizadas en el experimento y por lo tanto es una medida indirecta de la calidad de nuestros datos.
La principal aplicación de Mapman, es la detección de tendencias metabólicas mediante el estudio de bloques de genes anotados previamente (Thimm et al. 2004) y asignarlos a una serie de categorías funcionales jerarquizadas (BINs, subBINs, enzimas individuales, etc.). Esta herramienta permite al usuario determinar a través del test estadístico Wilcoxon Rank Sum aquellas categorías funcionales que muestran un
comportamiento diferente o están muy representadas en términos de perfiles de expresión en relación al resto de BINs, lo que sugeriría una tendencia.