You are here

    • You are here:
    • Home > Institutional > European Commission backs GENCODE with €19 million

European Commission backs GENCODE with €19 million

NewsNEWS

06
Oct
Tue, 06/10/2026 - 13:40

European Commission backs GENCODE with €19 million

Image of the Centre for Genomic Regulation’s laboratory spaces in Barcelona, which have hosted GENCODE researchers for more than twenty years

The European Commission has today announced €19 million of funding for GENCODE, one of the most important and widely used data and knowledge repositories in biology, also known as a biodata resource.

GENCODE is the reference map of human and mouse genes used by researchers worldwide across academia and the biotechnology and pharmaceutical industries. Out of 52 officially recognised global core biodata resources, a list of the most critical infrastructure for biological research data, it is the only project hosted in Spain, sharing responsibility with the UK and the United States.

Funded mainly by the US National Institutes of Health since 2003, Europe backing GENCODE ensures its future no longer rests on a single funder. The European Commission’s announcement recognises the catalogue’s importance in pushing the boundaries of science and advancing research in artificial intelligence and personalised medicine. The funding is for five years and will help long-term planning, technical maintenance and service continuity of the biodata resource.

GENCODE was conceived by Roderic Guigó in 2003, who coordinated the project until 2007 and continues to work on it as principal investigator at the CRG today. It is now run by EMBL’s European Bioinformatics Institute (EMBL-EBI) in Cambridge, UK, in partnership with the CRG in Barcelona. The broader international consortium includes research groups from MIT, Yale, Stanford, the University of California and the University of Michigan.

“AI tools are revolutionising biology, but their predictions are only as reliable as the reference they are built on and tested against. For more than two decades, GENCODE has been the reference for the map of human genes. By sustaining it, the Commission is making sure that the next wave of AI-driven innovation in biomedicine rests on knowledge that is accurate, open and continually improved. It also primes us to being at the forefront of a technology movement that will completely transform medicine,” says Roderic Guigó, principal investigator at the CRG.

The Commission cites GENCODE as an infrastructure it considers critical for EU economic security, for EU strategic interests, competitiveness and for addressing societal challenges such as global health, biodiversity and climate change. The life sciences sector serviced by infrastructures like GENCODE is collectively worth an estimated €1.5 trillion to Europe.

GENCODE is just one of the data resources managed by the CRG which the worldwide scientific community depends on. The institute co-coordinates the European Genome-phenome Archive (EGA) with EMBL-EBI since 2013 and also leads the Biodiversity Cell Atlas, an incipient international effort to chart cell types across the tree of life.

“This investment recognises more than two decades of work at the CRG and consolidates Barcelona as one of the places where the world’s most important biological data is looked after. It’s also critical for Europe’s sovereignty. We will continue our stewardship and serve the global scientific community,” adds Mónica Bettencourt-Dias, Director of the CRG.

Strengthening fragile biodata resources under European sovereignty

Unlike science projects like CERN, which are built in one place, biology relies on many different types of globally distributed, virtually connected databases. These biodata resources are invisible yet vital infrastructures for high scientific quality, research integrity and scientific reproducibility.

The European Commission’s announcement is part of a wider €65 million package to support life science infrastructures. It includes funding to support UniProt, the reference catalogue of protein sequences run by EMBL-EBI with the Swiss Institute of Bioinformatics (€30 million), and Europe PMC, the open repository of life sciences literature (€8 million), with a further €8 million open to competitive bids.

The investment responds to concerns raised by the Global Biodata Coalition, or GBC, which brings together ten different public, charitable, and international research funders including the US National Institutes of Health, the UK’s Wellcome Trust, the Chan Zuckerberg Initiative and the African Academy of Sciences.

The GBC has previously warned that biodata resources are struggling to secure the necessary funding to enable their long-term sustainability. The fragmented funding situation jeopardises their ability to support ever-increasing volumes of data. If they cannot scale up, they cannot curate, store or maintain data, nor make it openly searchable and retrievable. That in turn threatens life science discoveries and economic opportunity around the world.

The history and impact of GENCODE

The CRG’s Roderic Guigó was one of two scientists in Spain to take part in the Human Genome Project. The first sequence of human DNA was a major scientific feat. Surprisingly, it found only around two per cent of its three billion letters make proteins. The function of the remaining ninety-eight per cent remained unknown.

To answer that question, the worldwide scientific community launched ENCODE in 2003, soon after the conclusion of the Human Genome Project. However, before they could answer which stretches of DNA do what, scientists needed to know exactly where genes start and stop along the sequence.

Guigó conceived GENCODE as an arm of ENCODE. Funded by the US National Institutes of Health, he has remained one of the project’s principal investigators for more than twenty years. His group at the CRG continue to develop the sequencing and computational methods which support mapping human and mouse genes.

Thanks to GENCODE, researchers from around the world now have a map which describes where each gene begins and ends, which stretches of DNA make RNA and how many different versions of a gene a cell can produce. The various iterations of the catalogue have since become the reference annotation for human and mouse genomes worldwide, cited in at least 21,000 scientific publications.

The catalogue has transformed science. For example, CRISPR-Cas9 and other genetic editing tools rely on RNAs to cut or modify DNA at a precise location. GENCODE provides the accurate genomic reference needed to design these RNA molecules so they don’t accidentally target the wrong gene.

It’s also changed medicine through genetic diagnoses and prognoses. When a patient’s mutation is studied in any hospital around the world, GENCODE helps understand which gene is affected and whether it changes a protein. The human genetic database accelerated the development of mRNA therapies that target diseases like spinal muscular atrophy or the engineering of CAR-T cell therapies and personalised cancer vaccines.

The biodata is also used in artificial intelligence as well as in the laboratory. Google DeepMind’s AlphaGenome, published in Nature in January 2026, predicts how a change in DNA alters the way genes are switched on and used. The AI system relied on GENCODE as a trusted map of the genome to measure its own performance.

GENCODE has even led to scientists questioning the very definition of a gene. A study in Nature published back in 2012 drew on the catalogue to show that around three quarters of the human genome can be transcribed into RNA, and that a single cell typically produces ten to twelve different versions of a given gene.
 

EN CASTELLANO

La Comisión Europea respalda GENCODE con 19 millones de euros

La Comisión Europea ha anunciado hoy una financiación de 19 millones de euros para GENCODE, uno de los repositorios de datos y conocimiento más importantes y utilizados de la biología, denominados también recursos de datos biológicos o recursos de biodatos.

GENCODE es el mapa de referencia de los genes del ser humano y del ratón empleado por la comunidad científica a nivel mundial, tanto en el ámbito académico como en la industria biotecnológica y farmacéutica. De los 52 recursos de biodatos esenciales a escala mundial reconocidos oficialmente —una lista que reúne las infraestructuras más críticas para los datos de investigación biológica—, es el único proyecto con sede en España, una responsabilidad que comparte con Reino Unido y Estados Unidos.

Financiado principalmente por los Institutos Nacionales de Salud de Estados Unidos (NIH) desde 2003, GENCODE cuenta ahora con el respaldo de Europa, lo que garantiza que su futuro ya no dependa de un único financiador. El anuncio de la Comisión Europea reconoce la importancia del catálogo para ampliar las fronteras de la ciencia e impulsar la investigación en inteligencia artificial y medicina personalizada. La financiación, a cinco años, contribuirá a la planificación a largo plazo, al mantenimiento técnico y a la continuidad del servicio de este recurso de biodatos.

GENCODE fue concebido en 2003 por Roderic Guigó, que coordinó el proyecto hasta 2007 y sigue trabajando en él como investigador principal en el CRG. En la actualidad lo gestiona el Instituto Europeo de Bioinformática del EMBL (EMBL-EBI), con sede en Cambridge (Reino Unido), en colaboración con el CRG en Barcelona. El consorcio internacional en el que se integra incluye además grupos de investigación del MIT, Yale, Stanford, la Universidad de California y la Universidad de Míchigan.

"Las herramientas de inteligencia artificial están revolucionando la biología, pero sus predicciones solo pueden ser tan fiables como la referencia en base a la que se construyen y se ponen a prueba. Desde hace más de dos décadas, GENCODE es la referencia del mapa de los genes humanos. Al darle su apoyo, la Comisión se asegura de que la próxima oleada de innovación biomédica impulsada por la IA descanse sobre un conocimiento preciso, abierto y en constante mejora. Además, nos sitúa a la vanguardia de un movimiento tecnológico que transformará por completo la medicina", afirma Roderic Guigó, investigador principal del CRG.

La Comisión cita GENCODE como una infraestructura que considera crítica para la seguridad económica de la UE, sus intereses estratégicos y su competitividad, así como para afrontar retos sociales como la salud global, la biodiversidad y el cambio climático. El sector de las ciencias de la vida que da servicio a infraestructuras como GENCODE tiene en conjunto un valor estimado de 1,5 billones de euros para Europa.

GENCODE es solo uno de los recursos de datos que gestiona el CRG y de los que depende la comunidad científica mundial. Desde 2013, el instituto coordina junto al EMBL-EBI el European Genome-phenome Archive (EGA) y, además, lidera el Biodiversity Cell Atlas, una incipiente iniciativa internacional para cartografiar los tipos celulares de todo el árbol de la vida.

"Esta inversión reconoce más de dos décadas de trabajo en el CRG y consolida a Barcelona como uno de los lugares donde se custodian los datos biológicos más importantes del mundo. También es crucial para la soberanía europea. Seguiremos ejerciendo esta responsabilidad y sirviendo a la comunidad científica mundial", añade Mónica Bettencourt-Dias, directora del CRG.

Refuerzo de los frágiles recursos de biodatos bajo soberanía europea

A diferencia de proyectos científicos como el CERN, que se levantan en un único lugar, la biología depende de muchos tipos distintos de bases de datos repartidas por todo el mundo y conectadas virtualmente. Estos recursos de biodatos son infraestructuras invisibles, pero vitales para la calidad científica, la integridad de la investigación y la reproducibilidad de los resultados.

El anuncio de la Comisión Europea forma parte de un paquete más amplio, de 65 millones de euros, destinado a las infraestructuras de ciencias de la vida. Incluye financiación para UniProt, el catálogo de referencia de secuencias de proteínas que gestiona el EMBL-EBI junto al Swiss Institute of Bioinformatics (30 millones de euros), y para Europe PMC, el repositorio abierto de literatura sobre ciencias de la vida (8 millones de euros), además de otros 8 millones que se adjudicarán en una convocatoria competitiva.

La inversión responde a la preocupación expresada por la Global Biodata Coalition (GBC), que agrupa a diez entidades financiadoras de la investigación, públicas, benéficas e internacionales, entre ellas los NIH de Estados Unidos, el Wellcome Trust británico, la Chan Zuckerberg Initiative y la African Academy of Sciences.

La GBC ya ha advertido de que los recursos de biodatos tienen dificultades para obtener la financiación necesaria para garantizar su sostenibilidad a largo plazo. La fragmentación de esa financiación pone en riesgo su capacidad para absorber volúmenes de datos cada vez mayores. Si estos recursos no pueden crecer, tampoco pueden curar, almacenar ni mantener los datos, ni hacer que puedan consultarse y recuperarse en abierto. Y eso, a su vez, amenaza los descubrimientos en ciencias de la vida y las oportunidades económicas en todo el mundo.

Historia e impacto de GENCODE

Roderic Guigó, del CRG, fue uno de los dos científicos de España que participaron en el Proyecto Genoma Humano. La primera secuencia del ADN humano fue una gran hazaña científica. Sorprendentemente, reveló que solo en torno al 2% de sus tres mil millones de letras sirven para fabricar proteínas. La función del 98% restante seguía siendo una incógnita.

Para responder a esa pregunta, la comunidad científica internacional puso en marcha ENCODE en 2003, poco después de que concluyera el Proyecto Genoma Humano. Sin embargo, antes de averiguar qué hacía cada tramo del ADN, era necesario saber con exactitud dónde empezaban y dónde terminaban los genes a lo largo de la secuencia.

Guigó concibió GENCODE como una rama de ENCODE. Durante más de veinte años, en un proyecto financiado por los NIH estadounidenses, ha seguido siendo uno de sus investigadores principales. Su grupo en el CRG continúa desarrollando los métodos de secuenciación y computacionales que sustentan la cartografía de los genes humanos y del ratón.

Gracias a GENCODE, la comunidad investigadora de todo el mundo dispone hoy de un mapa que describe dónde empieza y dónde termina cada gen, qué tramos del ADN dan lugar a ARN y cuántas versiones distintas de un gen puede generar una célula. Las sucesivas versiones del catálogo se han convertido desde entonces en la anotación de referencia de los genomas humanos y del ratón en todo el mundo, y se han citado en al menos 21.000 publicaciones científicas.

El catálogo ha transformado la ciencia. Por ejemplo, CRISPR-Cas9 y otras herramientas de edición genética se sirven de moléculas de ARN para cortar o modificar el ADN en un punto preciso. GENCODE aporta la referencia genómica exacta que se necesita para diseñar esas moléculas de ARN y evitar que actúen por error sobre el gen equivocado.

También ha cambiado la medicina, a través del diagnóstico y el pronóstico genéticos. Cuando en cualquier hospital del mundo se estudia la mutación de un paciente, GENCODE ayuda a saber qué gen está afectado y si altera una proteína. Esta base de datos genética humana ha acelerado el desarrollo de terapias de ARN mensajero dirigidas a enfermedades como la atrofia muscular espinal, así como el diseño de terapias celulares CAR-T y de vacunas personalizadas contra el cáncer.

Los biodatos de GENCODE se utilizan tanto en el laboratorio como en la inteligencia artificial. AlphaGenome, el modelo de Google DeepMind publicado en Nature en enero de 2026, predice cómo un cambio en el ADN altera la manera en que los genes se activan y se utilizan. El sistema de IA se apoyó en GENCODE como mapa fiable del genoma para medir su propio rendimiento.

GENCODE ha incluso impulsado a la comunidad científica a replantearse la propia definición de gen. Un estudio publicado en Nature ya en 2012 se basó en el catálogo para demostrar que alrededor de tres cuartas partes del genoma humano pueden transcribirse en ARN y que una sola célula produce habitualmente entre diez y doce versiones distintas de un mismo gen.
 

EN CATALÀ

Suport de 19 milions d'euros de la Comissió Europea per a GENCODE

La Comissió Europea ha anunciat avui un finançament de 19 milions d'euros per a GENCODE, un dels repositoris de dades i coneixement més importants i utilitzats en biologia, també coneguts com a recursos de dades biològiques o recursos de biodades.

GENCODE és el mapa de referència dels gens humans i de ratolí utilitzat per la comunitat científica arreu del món, tant en l'àmbit acadèmic com en la indústria biotecnològica i farmacèutica. Dels 52 recursos de biodades essencials a escala mundial reconeguts oficialment —una llista que reuneix les infraestructures més crítiques per a les dades de recerca biològica—, és l'únic projecte amb seu a Espanya, una responsabilitat que comparteix amb el Regne Unit i els Estats Units.

Finançat principalment pels Instituts Nacionals de Salut (NIH) dels EUA des de 2003, GENCODE compta ara amb el suport d'Europa, assegurant que el seu futur ja no depengui d'un sol finançador. L'anunci de la Comissió Europea reconeix la importància del catàleg per expandir les fronteres de la ciència i impulsar la recerca en intel·ligència artificial i medicina personalitzada. El finançament de cinc anys contribuirà a la planificació a llarg termini, al manteniment tècnic i a la continuïtat del servei d'aquest recurs de biodades.

GENCODE va ser concebut el 2003 per Roderic Guigó, qui va coordinar el projecte fins al 2007 i continua treballant-hi com a investigador principal al CRG. Actualment, GENCODE està gestionat per l'Institut Europeu de Bioinformàtica de l'EMBL (EMBL-EBI), amb seu a Cambridge (Regne Unit), en col·laboració amb el CRG a Barcelona. El consorci internacional del qual forma part també inclou grups de recerca del MIT, Yale, Stanford, la Universitat de Califòrnia i la Universitat de Michigan.

"Les eines d'intel·ligència artificial estan revolucionant la biologia, però les seves prediccions només poden ser tan fiables com la referència sobre la qual estan construïdes i provades. Durant més de dues dècades, GENCODE ha estat la referència per al mapa dels gens humans. Amb el seu suport, la Comissió assegura que la propera onada d'innovació biomèdica impulsada per la IA es basi en un coneixement precís, obert i en constant millora. També ens situa al capdavant d'un moviment tecnològic que transformarà completament la medicina", diu Roderic Guigó, investigador sènior del CRG.

La Comissió cita GENCODE com una infraestructura que considera crítica per a la seguretat econòmica, els interessos estratègics i la competitivitat de la UE, així com per abordar reptes socials com la salut global, la biodiversitat i el canvi climàtic. El sector de les ciències de la vida que dona servei a infraestructures com GENCODE té, en conjunt, un valor estimat d'1,5 bilions d'euros per a Europa.

GENCODE és només un dels recursos de dades gestionats pel CRG i dels quals depèn la comunitat científica global. Des de 2013, l'institut coordina l'Arxiu Europeu de Genomes i Fenomes (EGA) amb EMBL-EBI i també lidera el Biodiversity Cell Atlas, una iniciativa internacional incipient per cartografiar els tipus cel·lulars de tot l'arbre de la vida.

"Aquesta inversió reconeix més de dues dècades de treball al CRG i consolida Barcelona com un dels llocs on es custodien les dades biològiques més importants del món. També és crucial per a la sobirania europea. Continuarem exercint aquesta responsabilitat i servint la comunitat científica global", afegeix Mónica Bettencourt-Dias, directora del CRG.

Enfortiment dels fràgils recursos de biodades sota la sobirania europea

A diferència de projectes científics com el CERN, que es construeixen en un sol lloc, la biologia depèn de molts tipus diferents de bases de dades repartides arreu del món i connectades virtualment. Aquests recursos de biodades són infraestructures invisibles, però vitals per a la qualitat científica, la integritat de la recerca i la reproductibilitat dels resultats.

L'anunci de la Comissió Europea forma part d'un paquet més ampli de 65 milions d'euros per a infraestructures de ciències de la vida. Inclou finançament per a UniProt, el catàleg de referència de seqüències proteiques gestionat per EMBL-EBI juntament amb l'Institut Suís de Bioinformàtica (30 milions d'euros), i per a Europa PMC, el repositori obert de literatura de ciències de la vida (8 milions d'euros), a més de 8 milions d'euros addicionals que s'atorgaran en una convocatòria competitiva.

La inversió respon a la preocupació expressada per la Coalició Global de Biodades (GBC, en les seves sigles en anglès), que reuneix deu entitats públiques, benèfiques i internacionals de finançament de recerca, incloent-hi els NIH als Estats Units, el Wellcome Trust britànic, la Chan Zuckerberg Initiative i l'Acadèmia Africana de Ciències.

La GBC ja ha advertit que els recursos de biodades tenen dificultats per obtenir el finançament necessari per garantir la seva sostenibilitat a llarg termini. La fragmentació d'aquest finançament posa en risc la seva capacitat d'absorbir volums cada cop més grans de dades. Si aquests recursos no poden créixer, tampoc no poden curar, emmagatzemar ni mantenir dades, ni fer que puguin consultar-se i recuperar-se en obert. I això, alhora, amenaça els descobriments en ciències de la vida i les oportunitats econòmiques arreu del món.

Història i impacte de GENCODE

Roderic Guigó, del CRG, va ser un dels dos científics d'Espanya que van participar en el Projecte Genoma Humà. La primera seqüència d'ADN humà va ser una gran fita científica. De manera sorprenent, va revelar que només aproximadament el 2% de les seves tres mil milions de lletres s'utilitzaven per fabricar proteïnes. La funció del 98% restant continuava essent una incògnita.

Per respondre aquesta pregunta, la comunitat científica internacional va posar en marxa ENCODE el 2003, poc després de la conclusió del Projecte Genoma Humà. Tanmateix, abans d'esbrinar què feia cada tram d'ADN, era necessari saber exactament on començaven i acabaven els gens al llarg de la seqüència.

Guigó va concebre GENCODE com una branca d'ENCODE. Durant més de vint anys, en un projecte finançat pels NIH americans, ha estat un dels seus investigadors principals. El seu grup al CRG continua desenvolupant els mètodes de seqüenciació i computació que sustenten el mapatge dels gens humans i de ratolí.

Gràcies a GENCODE, la comunitat investigadora d'arreu del món disposa ara d'un mapa que descriu on comença i acaba cada gen, quins trams d'ADN donen lloc a l'ARN i quantes versions diferents d'un gen pot generar una cèl·lula. Les versions successives del catàleg s'han convertit des de llavors en l'anotació de referència per als genomes humans i de ratolí a tot el món, i han estat citades en almenys 21.000 publicacions científiques.

El catàleg ha transformat la ciència. Per exemple, CRISPR-Cas9 i altres eines d'edició genètica utilitzen molècules d'ARN per tallar o modificar l'ADN en un punt precís. GENCODE proporciona la referència genòmica exacta necessària per dissenyar aquestes molècules d'ARN i evitar que actuïn erròniament sobre el gen equivocat.

També ha canviat la medicina, a través del diagnòstic genètic i el pronòstic. Quan s'estudia la mutació d'un pacient en qualsevol hospital del món, GENCODE ajuda a saber quin gen està afectat i si altera una proteïna. Aquesta base de dades genètica humana ha accelerat el desenvolupament de teràpies d'ARN missatger dirigides a malalties com l'atròfia muscular espinal, així com el disseny de teràpies amb cèl·lules CAR-T i vacunes personalitzades contra el càncer.

Les biodades de GENCODE s'utilitzen tant al laboratori com a la intel·ligència artificial. AlphaGenome, el model de Google DeepMind publicat a Nature el gener de 2026, prediu com un canvi en l'ADN altera la manera com s'activen i s'utilitzen els gens. El sistema d'IA es basà en GENCODE com a mapa fiable del genoma per mesurar el seu propi rendiment.

GENCODE fins i tot ha impulsat la comunitat científica a repensar la pròpia definició de gen. Un estudi publicat a Nature el 2012 ja es va basar en el catàleg per mostrar que al voltant de tres quartes parts del genoma humà es poden transcriure en ARN i que una sola cèl·lula sol produir entre deu i dotze versions diferents del mateix gen.