Inteligencia artificial
Contar fauna desde el aire sin dibujar cajas: un modelo abierto contó caribúes con solo +3,1 % de error
Investigadores de Microsoft AI for Good y socios publicaron OWL, un modelo abierto que cuenta animales en imágenes aéreas entrenándose solo con puntos, no con cajas. Lo probaron en cinco bases de datos y en el censo de caribúes de Alaska de 2022. Qué logró, dónde falla y por qué importa para cualquier conteo de fauna desde avioneta o dron.
¿Buscas el trámite y no la noticia? Guías de trámites ambientales, con su norma, su autoridad competente y sus fuentes oficiales.
Para enseñarle a una inteligencia artificial a contar animales en una foto aérea, alguien tiene que marcar, uno por uno, cada animal de miles de imágenes. Dibujar una caja alrededor de cada individuo es el método clásico, y es tan lento que muchos archivos de censos históricos nunca se aprovecharon. Un equipo liderado por Microsoft AI for Good propone saltarse las cajas: marcar solo un punto en el centro de cada animal.
Se llama Overhead Wildlife Locator (OWL), y su preprint se publicó en arXiv el 11 de junio de 2026. Es un trabajo aún sin revisión por pares, pero con un ensayo poco común: los autores lo aplicaron al censo de caribúes de 2022 del Departamento de Pesca y Caza de Alaska.
Por qué las cajas frenan el conteo
Los conteos tradicionales desde avioneta dependen de observadores humanos. El preprint recuerda que esas cifras tienden a subestimar y varían mucho entre observadores. La visión por computador automatizó el análisis, pero chocó con otro cuello de botella: los detectores estándar exigen cajas, que según trabajos que cita el preprint serían hasta siete veces más lentas de producir y unas tres veces más caras que los puntos.
Los puntos tienen otra ventaja práctica. Los archivos históricos del programa de Alaska, según los autores, consisten enteramente en anotaciones de punto heredadas, así que un detector de cajas exigiría volver a anotarlo todo.
Para una pregunta como "cuántos animales hay y dónde están", el preprint recoge trabajos previos que sugieren que el punto basta. El trabajo de May y colegas que cita muestra que la precisión del conteo se conserva en buena medida, con un aumento de a lo sumo 2,5 veces en el error medio a cambio de reducir el esfuerzo de anotación siete veces.
Tres variantes para tres tipos de escena
OWL no es un solo modelo sino tres, según el preprint:
- OWL-C: totalmente convolucional, pensado para procesar mucho volumen rápido.
- OWL-T: híbrido con bloques Swin, para escenas heterogéneas y con desorden.
- OWL-D: construido sobre un codificador congelado DINOv3 ViT-H+/16, un modelo fundacional de visión.
Los autores los compararon con POLO, YOLOv11n y YOLOv11l en cinco conjuntos de datos aéreos públicos, desde sabanas fotografiadas con avioneta hasta corrales densos vistos con dron, y contra HerdNet en su propia base, Delplanque.
| Escena | Resultado reportado (AP) |
|---|---|
| Delplanque (sabana africana, avioneta) | OWL-D 0,934; OWL-C 0,901; OWL-T 0,900; HerdNet 0,840 |
| SheepCounter (ovejas muy densas, dron) | OWL-T 0,978; OWL-D 0,834 |
OWL-D logró la mayor precisión promedio en cuatro de los cinco conjuntos. Pero en SheepCounter se desplomó: los autores reportan un subconteo de la población del 12,9 % (frente a 1,1 % de OWL-T) y lo dejan como observación abierta, con tres hipótesis por probar; una es que cada animal ocupa apenas unos pocos parches del codificador. La lección es incómoda para quien quiera elegir "el mejor" modelo: el mejor depende de la densidad de animales de la escena.

El ensayo con caribúes de Alaska
La prueba más exigente fue con datos reales de una agencia gubernamental. Los autores entrenaron OWL-C con mosaicos de la Manada de Caribú del Porcupine de 2017 y lo aplicaron, sin reentrenarlo, a otra manada (la Central del Ártico), cinco años después y con otra configuración de cámaras.
| Dato del ensayo | Valor según el preprint |
|---|---|
| Mosaicos del censo 2022 | 44, con 17,39 gigapíxeles (48,6 GB) |
| Resolución en el terreno | 2,2 a 4,0 cm por píxel |
| Parches de prueba públicos | 2.607, con 12.456 animales marcados |
| F1 / recall / precisión | 0,965 / 0,980 / 0,951 |
| Falsos positivos en terreno vacío | 12 detecciones; 98,7 % de parches vacíos sin detección |
Un detalle de honestidad científica merece crédito: el umbral de conteo se eligió para minimizar el error sobre los mismos parches de prueba, y los autores lo dicen sin rodeos. Por eso agregan que el F1 varía solo 0,004 entre umbrales de 0,18 a 0,23, es decir que el resultado no depende de un ajuste fino. También describen un fallo típico: parches de nieve derritiéndose junto al agua y al pasto a veces se confunden con caribúes.
Cuánto cuesta correrlo
El preprint mide la velocidad en una GPU NVIDIA A100. OWL-T procesa cerca de 49 parches por segundo, mientras que OWL-D, con su codificador de 840,6 millones de parámetros, baja a 5,0 parches por segundo. Aun así, un censo de 100.000 parches, unos 26 gigapíxeles, se completaría en cerca de 5,5 horas en una sola A100. No es tiempo real, pero sí un procesamiento por lotes viable para un censo completo.
El código está bajo licencia MIT en GitHub, y según el repositorio los modelos entrenados se publican en Zenodo. Los autores también liberaron los parches anotados de las dos manadas, que describen como los primeros conjuntos abiertos a nivel de parche para censos aéreos de caribú a gran escala.

Lo documentado y lo que aún es hipótesis
Lo documentado: OWL existe, es abierto, superó a HerdNet en su base de referencia y contó una manada de caribúes con un error agregado de +3,1 % en parches de prueba. Los propios autores listan límites: uno de los conjuntos tiene solo 7 imágenes de prueba, varias comparaciones entre modelos son estadísticamente inconclusas, y la prueba de "terreno vacío" a escala de censo completo sigue pendiente.
Lo hipotético es cualquier uso fuera de lo probado. Los datos del estudio son sabanas africanas, ganado, ovejas y terreno ártico; ninguno es dosel cerrado de bosque. Un método así podría servir para contar fauna grande en humedales, sabanas inundables o llanuras de la Orinoquía, el Pantanal o los Llanos venezolanos, o para ganado dentro de áreas protegidas. Eso exigiría anotar algunos puntos locales y validar el resultado, porque nada en el preprint prueba que funcione en esos paisajes.
Qué cambia para quien cuenta fauna
La consecuencia práctica no es un modelo más preciso, sino una barrera más baja. Muchos equipos tienen décadas de censos con puntos marcados a mano y nunca los pudieron usar para entrenar un detector moderno. Si el enfoque se sostiene fuera de Alaska, ese archivo pasa de papel muerto a material de entrenamiento.
Mi lectura: el aporte más valioso de OWL es el aviso de que no existe un modelo único para todas las escenas, y de que publicar los parches anotados vale tanto como publicar el código. Antes de confiar en un conteo automático, conviene preguntar por la densidad de la escena, por el umbral y por cuánto terreno vacío se probó.
Juan Felipe Romero
Ecólogo
Soy ecólogo con posgrado en Administración Ambiental de Zonas Costeras y Máster en Restauración Ecológica, con más de 18 años de experiencia en planificación, gestión y desarrollo de soluciones tecnológicas ambientales.
Este artículo se redactó con apoyo de inteligencia artificial, bajo dirección editorial de Juan Felipe Romero.
Sigue leyendo
Drones
Un sistema de dron de 650 dólares ya iguala a un piloto humano monitoreando fauna: el salto de cámara voladora a plataforma autónoma
Juan Felipe Romero · 14 de agosto de 2026Inteligencia artificial
Un modelo de IA entrenado con 65 millones de fotos ya identifica fauna de cámara trampa en 2.498 categorías, y es gratis
Juan Felipe Romero · 15 de septiembre de 2026Inteligencia artificial
Un nodo solar de código abierto ya vigila fauna en el Magdalena Medio y la Amazonía colombiana sin que nadie tenga que visitarlo
Juan Felipe Romero · 11 de septiembre de 2026Boletín semanal
¿Qué cambió esta semana en la norma ambiental?
Cada lunes, un correo con las resoluciones y decretos ambientales que salieron esa semana en Colombia: qué exige cada uno, desde cuándo aplica y el enlace al texto oficial.



