Demo

Inteligencia artificial

11.609 videos de cámara trampa con cada animal recortado cuadro a cuadro: el conjunto abierto que enseña a la IA a seguir fauna en el trópico

SA-FARI, presentado en CVPR 2026 por Conservation X Labs, Meta y una coalición de organizaciones de conservación, reúne 11.609 videos de cámara trampa de 741 sitios con máscaras de segmentación por animal. Qué contiene, qué mejoró en los modelos y qué límites trae, incluida su licencia.

Juan Felipe Romero12 min de lectura
inteligencia artificialcámaras trampamonitoreo de biodiversidadconjuntos de datos abiertosconservación

¿Buscas el trámite y no la noticia? Guías de trámites ambientales, con su norma, su autoridad competente y sus fuentes oficiales.

11.609 videos de cámara trampa con cada animal recortado cuadro a cuadro: el conjunto abierto que enseña a la IA a seguir fauna en el trópico

La mayoría de los proyectos de cámaras trampa responde una pregunta por imagen: qué especie hay en la foto. Pero cuando la cámara graba video y pasan tres pecaríes seguidos, la pregunta real es otra: cuántos individuos son, cuál es cuál y por dónde se movieron. Ese problema se llama seguimiento de múltiples animales, y le ha faltado el insumo básico para que la IA lo resuelva bien: datos de campo variados y anotados con cuidado.

En 2026 apareció uno. Se llama SA-FARI, lo presentaron Conservation X Labs, Meta y una coalición de organizaciones de conservación en la conferencia de visión por computador CVPR 2026, y es, según sus autores, el mayor conjunto de datos abierto de este tipo para animales silvestres.


Qué contiene exactamente

El artículo de SA-FARI describe 11.609 videos de cámara trampa recogidos durante unos 10 años (2014 a 2024) en 741 sitios de 4 continentes, con 99 categorías de especies. Cada video está anotado de forma exhaustiva: sobre cada animal hay una máscara de segmentación (el contorno exacto, no solo una caja) que se sigue de un cuadro a otro, lo que los autores llaman masklet.

16.224 individuosseguidos con máscara en unas 46 horas de video anotado, con 942.702 cajas, máscaras y etiquetas de especie (fuente: artículo de SA-FARI, arXiv 2511.15622).

Los autores comparan el tamaño con lo que había: 5 veces más duración anotada y el doble de diversidad de especies que cualquier conjunto previo para esta tarea. Los datos vienen de siete organizaciones asociadas, entre ellas Osa Conservation, la Estación Biológica Los Amigos y el Programa Panafricano de chimpancés, y de ecorregiones de África central, Suramérica, Mesoamérica y el sur de Europa.

DatoCifra
Videos11.609
Sitios de muestreo independientes741 (650 en entrenamiento, 91 en prueba)
Categorías de especies99
Duración anotadaunas 46 horas
Individuos con máscara (masklets)16.224
Videos de cámaras en copas de árboles (Costa Rica)2.790, a 8 a 24 m del suelo
Investigadora agachada en un bosque húmedo tropical revisando videos de cámara trampa en un portátil robusto
Revisar video de cámara trampa a mano es el cuello de botella que este tipo de conjuntos busca aliviar. Ilustración conceptual, no una imagen del estudio.Crédito: Imagen generada con IA (openai/gpt-image-2).

Un conjunto con acento neotropical

Hay un detalle del artículo que importa a quien trabaja en bosques de América: según los autores, la mayor cantidad de datos y la mayor variedad de especies vinieron de los sitios de Suramérica y Mesoamérica. Las tres categorías más frecuentes son monos araña, pecaríes de collar y agutíes. Además, 29 de las 99 categorías aportan el 90% de los datos, de modo que la cola de especies raras es larga y escasa.

Un caso llama la atención: 2.790 videos de Costa Rica se grabaron con cámaras instaladas en las copas, entre 8 y 24 metros del suelo. Casi todos los conjuntos de cámaras trampa miran el sotobosque; este incluye el dosel, donde viven buena parte de los primates y aves del trópico.

Por clases, 67 de las 99 categorías (67,7%) son mamíferos, 27 (27%) aves, 4 reptiles y 1 anfibio. Es un sesgo hacia vertebrados grandes y medianos que los propios autores reconocen al pedir, para futuras versiones, más ecorregiones que reduzcan el sesgo geográfico.

Qué mejoró en los modelos, con cifras

SA-FARI se construyó con el modelo SAM 3 de Meta: este hizo una primera segmentación automática (a 6 cuadros por segundo) y anotadores humanos revisaron y corrigieron las máscaras. Después sirvió de banco de pruebas para modelos de lenguaje y visión.

El resultado más claro del artículo es lo que pasa cuando el modelo ve datos como estos. Al ajustar SAM 3 con SA-FARI, la métrica cgF1 (qué tan bien detecta y segmenta cada concepto) pasó de 14,0 a 46,9, y la pHOTA (detección más seguimiento) de 48,5 a 68,1, es decir, ganancias de 32,9 y 19,6 puntos. Los autores lo resumen como una mejora de tres veces frente a la línea base.

14,0 a 46,9cgF1 de SAM 3 antes y después de ajustarlo con SA-FARI, en la prueba con el nombre de la especie como indicación (fuente: artículo de SA-FARI, tabla 3).

En la prueba más cercana a la práctica de muchos proyectos, donde solo se pide "animal" sin decir de qué especie, SAM 3 entrenado con SA-FARI alcanzó un IDF1 de 71,1 y un HOTA de 64,4. El mejor de los sistemas que combinan MegaDetector con un algoritmo de seguimiento llegó a 47,2 de IDF1 (MegaDetector con BoostSort++) y a 45,5 de HOTA (con OCSort).

Cámara trampa en la copa de un árbol del bosque tropical con un mono araña pasando por una rama gruesa, en movimiento
Los videos de cámaras en el dosel (2.790 en Costa Rica) son parte de lo que distingue a SA-FARI de otros conjuntos. Ilustración conceptual, no un fotograma del conjunto de datos.Crédito: Imagen generada con IA (openai/gpt-image-2).

Los límites que el propio estudio deja a la vista

Primero, los animales pequeños siguen siendo difíciles. En el conjunto de prueba, el rendimiento con máscaras grandes superó al de las pequeñas por 29,2 puntos de pHOTA (81,4 frente a 52,2). Segundo, los animales que se mueven mucho o se tapan entre sí son más difíciles de seguir, no tanto de detectar.

Tercero, la prueba usa 833 videos de 91 sitios que no aparecen en el entrenamiento, y los 598 videos nocturnos rindieron de forma comparable al conjunto completo (66,0 frente a 68,1 de pHOTA). Es una buena señal, pero está medida sobre las especies y los sitios del propio conjunto.

Cuarto, la licencia. La página del proyecto lo describe como disponible "sin barreras de pago ni restricciones", pero la ficha en Hugging Face indica licencia CC-BY-NC 4.0 y pide aceptar condiciones para acceder. NC significa uso no comercial: una universidad o una ONG puede entrenar con él, pero una consultora que venda un servicio con un modelo entrenado sobre estos datos debería leer los términos antes de asumir que puede.

Qué podría significar para los proyectos de monitoreo

Lo que sigue es hipótesis de este artículo, no un resultado del estudio. Si un modelo ajustado con datos como estos sigue a cada individuo en un video, un equipo podría pasar de contar eventos (cuántos videos tienen pecaríes) a estimar cuántos animales distintos hay en un grupo y cómo se desplazan, insumos que alimentan estimaciones de abundancia y de uso del hábitat. Ese paso exigiría validar el modelo con videos propios del sitio, porque 741 sitios no cubren todos los bosques.

También abre una pregunta práctica para quien monitorea fauna neotropical con cámaras: cuánto video etiquetado propio hace falta para ajustar un modelo así a especies que SA-FARI no incluye. El estudio no la responde. Lo que sí ofrece es un punto de partida público y un banco de pruebas común para medir si un modelo mejora o solo parece que mejora.

Conclusión

SA-FARI no es un producto listo para instalar: es un conjunto de datos, y su valor depende de que otros lo usen para construir y comparar modelos. Pero resuelve una carencia real, la de tener video del trópico anotado individuo por individuo y a escala, y lo hace con cifras que cualquiera puede revisar en el artículo. Para el monitoreo con cámaras, la lección práctica es doble: el dato bien anotado mueve más al modelo que el tamaño del modelo, y la licencia merece leerse con la misma atención que la tabla de resultados.


Portada: ilustración conceptual de pecaríes de collar en un fotograma infrarrojo de cámara trampa. Imagen generada con IA (openai/gpt-image-2).

Juan Felipe Romero

Ecólogo

Soy ecólogo con posgrado en Administración Ambiental de Zonas Costeras y Máster en Restauración Ecológica, con más de 18 años de experiencia en planificación, gestión y desarrollo de soluciones tecnológicas ambientales.

Este artículo se redactó con apoyo de inteligencia artificial, bajo dirección editorial de Juan Felipe Romero.

Volver al blog

Sigue leyendo