Demo

Inteligencia artificial

Contar fauna desde el aire sin dibujar cajas: un modelo abierto contó caribúes con solo +3,1 % de error

Investigadores de Microsoft AI for Good y socios publicaron OWL, un modelo abierto que cuenta animales en imágenes aéreas entrenándose solo con puntos, no con cajas. Lo probaron en cinco bases de datos y en el censo de caribúes de Alaska de 2022. Qué logró, dónde falla y por qué importa para cualquier conteo de fauna desde avioneta o dron.

Juan Felipe Romero11 min de lectura
inteligencia artificialmonitoreo de biodiversidaddronescódigo abiertociencia de conservación

¿Buscas el trámite y no la noticia? Guías de trámites ambientales, con su norma, su autoridad competente y sus fuentes oficiales.

Contar fauna desde el aire sin dibujar cajas: un modelo abierto contó caribúes con solo +3,1 % de error

Para enseñarle a una inteligencia artificial a contar animales en una foto aérea, alguien tiene que marcar, uno por uno, cada animal de miles de imágenes. Dibujar una caja alrededor de cada individuo es el método clásico, y es tan lento que muchos archivos de censos históricos nunca se aprovecharon. Un equipo liderado por Microsoft AI for Good propone saltarse las cajas: marcar solo un punto en el centro de cada animal.

Se llama Overhead Wildlife Locator (OWL), y su preprint se publicó en arXiv el 11 de junio de 2026. Es un trabajo aún sin revisión por pares, pero con un ensayo poco común: los autores lo aplicaron al censo de caribúes de 2022 del Departamento de Pesca y Caza de Alaska.

+3,1 %error de conteo con signo del modelo OWL-C en el conjunto de prueba de caribúes de la Manada Central del Ártico: 12.840 animales predichos frente a 12.456 marcados por humanos, según el preprint

Por qué las cajas frenan el conteo

Los conteos tradicionales desde avioneta dependen de observadores humanos. El preprint recuerda que esas cifras tienden a subestimar y varían mucho entre observadores. La visión por computador automatizó el análisis, pero chocó con otro cuello de botella: los detectores estándar exigen cajas, que según trabajos que cita el preprint serían hasta siete veces más lentas de producir y unas tres veces más caras que los puntos.

Los puntos tienen otra ventaja práctica. Los archivos históricos del programa de Alaska, según los autores, consisten enteramente en anotaciones de punto heredadas, así que un detector de cajas exigiría volver a anotarlo todo.

Para una pregunta como "cuántos animales hay y dónde están", el preprint recoge trabajos previos que sugieren que el punto basta. El trabajo de May y colegas que cita muestra que la precisión del conteo se conserva en buena medida, con un aumento de a lo sumo 2,5 veces en el error medio a cambio de reducir el esfuerzo de anotación siete veces.

Tres variantes para tres tipos de escena

OWL no es un solo modelo sino tres, según el preprint:

  • OWL-C: totalmente convolucional, pensado para procesar mucho volumen rápido.
  • OWL-T: híbrido con bloques Swin, para escenas heterogéneas y con desorden.
  • OWL-D: construido sobre un codificador congelado DINOv3 ViT-H+/16, un modelo fundacional de visión.

Los autores los compararon con POLO, YOLOv11n y YOLOv11l en cinco conjuntos de datos aéreos públicos, desde sabanas fotografiadas con avioneta hasta corrales densos vistos con dron, y contra HerdNet en su propia base, Delplanque.

EscenaResultado reportado (AP)
Delplanque (sabana africana, avioneta)OWL-D 0,934; OWL-C 0,901; OWL-T 0,900; HerdNet 0,840
SheepCounter (ovejas muy densas, dron)OWL-T 0,978; OWL-D 0,834

OWL-D logró la mayor precisión promedio en cuatro de los cinco conjuntos. Pero en SheepCounter se desplomó: los autores reportan un subconteo de la población del 12,9 % (frente a 1,1 % de OWL-T) y lo dejan como observación abierta, con tres hipótesis por probar; una es que cada animal ocupa apenas unos pocos parches del codificador. La lección es incómoda para quien quiera elegir "el mejor" modelo: el mejor depende de la densidad de animales de la escena.

Grupo de caribúes pastando en una ladera de tundra
Caribúes pastando en tundra abierta. Contarlos a ojo desde el aire es lento y varía entre observadores; por eso se automatiza el análisis de las fotos aéreas. Crédito: Imagen de dominio público, vía Wikimedia Commons.

El ensayo con caribúes de Alaska

La prueba más exigente fue con datos reales de una agencia gubernamental. Los autores entrenaron OWL-C con mosaicos de la Manada de Caribú del Porcupine de 2017 y lo aplicaron, sin reentrenarlo, a otra manada (la Central del Ártico), cinco años después y con otra configuración de cámaras.

Dato del ensayoValor según el preprint
Mosaicos del censo 202244, con 17,39 gigapíxeles (48,6 GB)
Resolución en el terreno2,2 a 4,0 cm por píxel
Parches de prueba públicos2.607, con 12.456 animales marcados
F1 / recall / precisión0,965 / 0,980 / 0,951
Falsos positivos en terreno vacío12 detecciones; 98,7 % de parches vacíos sin detección

Un detalle de honestidad científica merece crédito: el umbral de conteo se eligió para minimizar el error sobre los mismos parches de prueba, y los autores lo dicen sin rodeos. Por eso agregan que el F1 varía solo 0,004 entre umbrales de 0,18 a 0,23, es decir que el resultado no depende de un ajuste fino. También describen un fallo típico: parches de nieve derritiéndose junto al agua y al pasto a veces se confunden con caribúes.

Cuánto cuesta correrlo

El preprint mide la velocidad en una GPU NVIDIA A100. OWL-T procesa cerca de 49 parches por segundo, mientras que OWL-D, con su codificador de 840,6 millones de parámetros, baja a 5,0 parches por segundo. Aun así, un censo de 100.000 parches, unos 26 gigapíxeles, se completaría en cerca de 5,5 horas en una sola A100. No es tiempo real, pero sí un procesamiento por lotes viable para un censo completo.

El código está bajo licencia MIT en GitHub, y según el repositorio los modelos entrenados se publican en Zenodo. Los autores también liberaron los parches anotados de las dos manadas, que describen como los primeros conjuntos abiertos a nivel de parche para censos aéreos de caribú a gran escala.

Biólogo sentado en un helicóptero del Servicio de Pesca y Vida Silvestre de Estados Unidos antes de un vuelo
Un biólogo del Servicio de Pesca y Vida Silvestre de Estados Unidos en un helicóptero, antes de un vuelo. Los censos aéreos combinan observadores y, cada vez más, fotografía de alta resolución. Crédito: USFWS, dominio público, vía Wikimedia Commons.

Lo documentado y lo que aún es hipótesis

Lo documentado: OWL existe, es abierto, superó a HerdNet en su base de referencia y contó una manada de caribúes con un error agregado de +3,1 % en parches de prueba. Los propios autores listan límites: uno de los conjuntos tiene solo 7 imágenes de prueba, varias comparaciones entre modelos son estadísticamente inconclusas, y la prueba de "terreno vacío" a escala de censo completo sigue pendiente.

Lo hipotético es cualquier uso fuera de lo probado. Los datos del estudio son sabanas africanas, ganado, ovejas y terreno ártico; ninguno es dosel cerrado de bosque. Un método así podría servir para contar fauna grande en humedales, sabanas inundables o llanuras de la Orinoquía, el Pantanal o los Llanos venezolanos, o para ganado dentro de áreas protegidas. Eso exigiría anotar algunos puntos locales y validar el resultado, porque nada en el preprint prueba que funcione en esos paisajes.

Qué cambia para quien cuenta fauna

La consecuencia práctica no es un modelo más preciso, sino una barrera más baja. Muchos equipos tienen décadas de censos con puntos marcados a mano y nunca los pudieron usar para entrenar un detector moderno. Si el enfoque se sostiene fuera de Alaska, ese archivo pasa de papel muerto a material de entrenamiento.

Mi lectura: el aporte más valioso de OWL es el aviso de que no existe un modelo único para todas las escenas, y de que publicar los parches anotados vale tanto como publicar el código. Antes de confiar en un conteo automático, conviene preguntar por la densidad de la escena, por el umbral y por cuánto terreno vacío se probó.

Juan Felipe Romero

Ecólogo

Soy ecólogo con posgrado en Administración Ambiental de Zonas Costeras y Máster en Restauración Ecológica, con más de 18 años de experiencia en planificación, gestión y desarrollo de soluciones tecnológicas ambientales.

Este artículo se redactó con apoyo de inteligencia artificial, bajo dirección editorial de Juan Felipe Romero.

Volver al blog

Sigue leyendo