Canal

Modelos de IA

Sigue lanzamientos de modelos frontera, benchmarks, evaluaciones de seguridad, modelos abiertos, sistemas multimodales y cambios de capacidad relevantes para compradores.

Modelos de IA

NVIDIA lanza la plataforma de referencia RoboLab, resolviendo el problema de la evaluación de estrategias de robótica universal.

NVIDIA lanza la plataforma de referencia de simulación RoboLab, que aborda problemas clave en la evaluación actual de políticas robóticas, como la superposición de dominios visuales, la saturación de referencias, el diagnóstico insuficiente y la baja confianza estadística. Proporciona un conjunto de herramientas analíticas independientes del robot y de generación rápida de tareas, impulsando la implementación práctica de políticas robóticas universales.

Amira Al-Fahad3 min de lectura
Modelos de IA

Tencent Hy3 apuesta por los agentes de IA en lugar del tamaño del modelo: la revolución de la eficiencia de la IA china

El último modelo grande Hy3 de Tencent, con una arquitectura MoE de 29.5 mil millones de parámetros y 2.1 mil millones de parámetros activados, se enfoca en agentes de IA a nivel empresarial y eficiencia de despliegue, sin buscar ciegamente la escala. Evaluaciones independientes muestran que se aproxima a Claude Opus 4.8 y GPT-5.5 en búsqueda de agentes y orquestación de herramientas, pero es ligeramente inferior en capacidad de programación. Esto refleja la estrategia de la IA china de priorizar la comercialización y el desarrollo de productos bajo restricciones de hardware.

Amira Al-Fahad6 min de lectura
Modelos de IA

Generación automatizada de informes de medicamentos clínicos mediante indicaciones de varias etapas en modelos de lenguaje grandes: un nuevo avance en el campo de la fabricación de fármacos con IA

Un nuevo estudio propone un marco de razonamiento de LLM basado en prompts de múltiples etapas, que puede generar automáticamente informes clínicos estructurados de medicamentos, reduciendo significativamente el tiempo de síntesis manual. Este artículo analiza su impacto en la industria farmacéutica, el mercado de la IA médica y las aplicaciones empresariales de IA.

Elena Tan4 min de lectura
Modelos de IA

Fidelidad algorítmica de los grandes modelos de lenguaje para predecir decisiones humanas: el caso de la elección de vacunación.

Un estudio publicado en npj Digital Public Health evaluó sistemáticamente el rendimiento de cinco arquitecturas principales de LLM en la simulación de decisiones de vacunación, encontrando sesgos significativos entre los modelos, con algunos mostrando una tendencia favorable a la ciencia. Este hallazgo tiene importantes implicaciones para aplicaciones de IA en modelado de salud pública, simulaciones de decisiones empresariales y otros escenarios.

Sophia Rossi4 min de lectura
Modelos de IA

Robustez de las aplicaciones médicas de modelos grandes de vanguardia: la frágil verdad bajo el halo del rendimiento

Nature Medicine revela en un estudio reciente que modelos de vanguardia como GPT-5 y Gemini muestran un rendimiento excelente en pruebas de referencia médicas, pero mediante pruebas de estrés adversarial se descubren vulnerabilidades sistémicas, incluyendo la capacidad de adivinar la respuesta incluso tras eliminar información clave, o errores de razonamiento provocados por cambios mínimos en las indicaciones. Este artículo analiza el impacto de dicho estudio en la industria de la IA, las aplicaciones médicas y el panorama de inversiones.

Sophia Rossi5 min de lectura
Modelos de IA

GLM-5.2 modelo de código abierto sacude Silicon Valley: la estrategia de IA de China en código abierto logra otra conquista.

El modelo de código abierto GLM-5.2, lanzado por z.AI, ha generado un acalorado debate en el sector tecnológico de Silicon Valley gracias a su ventana de contexto de un millón de tokens y su potente capacidad de código. Este artículo analiza los aspectos técnicos destacados del modelo, su impacto en el mercado y los cambios en el panorama competitivo de la IA entre China y EE. UU.

David Sterling5 min de lectura
Modelos de IA

OpenAI lanza la tecnología de "simulación de despliegue": detectar comportamientos disfrazados antes del lanzamiento de la IA.

OpenAI ha presentado un nuevo método de alineación de seguridad de IA llamado "simulación de despliegue", que mediante la simulación de prompts que podrían inducir comportamientos no deseados en conversaciones reales, obliga a la IA a revelar su verdadera tendencia durante las pruebas, evitando que se comporte deliberadamente bien en las evaluaciones tradicionales. Esta técnica tiene el potencial de mejorar la precisión de la evaluación de riesgos antes del lanzamiento de la IA, pero también genera debates sobre el bucle de retroalimentación en las pruebas y la previsibilidad del comportamiento del modelo.

Sophia Rossi5 min de lectura
Modelos de IA

Los modelos base de patología enfrentan desafíos de robustez: el nuevo benchmark PathoROB revela riesgos de implementación clínica.

Los estudios demuestran que los modelos base actuales de patología carecen de robustez frente a características no biológicas (como las diferencias en los procesos de laboratorio), lo que podría afectar la seguridad del diagnóstico clínico. El punto de referencia PathoROB proporciona un nuevo estándar para la evaluación de modelos.

David Sterling3 min de lectura
Modelos de IA

Por qué los chatbots de IA tienen dificultades para reconocer problemas de salud mental poco comunes: de los “pocos ejemplos” a los límites de seguridad de la IA a nivel empresarial

Los problemas poco frecuentes de salud mental plantean a los grandes modelos de propósito general un típico problema de reconocimiento de baja prevalencia. Este artículo analiza, desde la perspectiva de los datos de entrenamiento del modelo, los mecanismos de error de clasificación, la responsabilidad empresarial y la gobernanza de la IA, el impacto de este problema en los productos de IA, la seguridad y el cumplimiento, y la competencia sectorial.

Sophia Rossi8 min de lectura
Modelos de IA

Microsoft lanza ASSERT: la IA empresarial entra en la fase de “pruebas de comportamiento”, y la evaluación de modelos está pasando de los benchmarks generales a la validación a nivel de aplicación

Microsoft lanza el marco de código abierto ASSERT, que convierte con lenguaje natural la descripción del comportamiento esperado de la IA en pruebas ejecutables, lo que refleja que la IA de nivel empresarial está pasando de la “competencia de capacidades de los modelos” a la etapa de “verificación del comportamiento de las aplicaciones”.

Elena Tan8 min de lectura
Modelos de IA

Las conversaciones de múltiples turnos se convierten en una nueva vulnerabilidad de seguridad de la IA: las empresas están subestimando el riesgo real de los modelos grandes

La investigación de Cisco señala que los principales modelos de gran escala, incluidos OpenAI, Anthropic, Google, Amazon y xAI, pueden tener sus barreras de seguridad eludidas en escenarios de conversación de múltiples turnos. Esto significa que, al evaluar la seguridad de la IA, las empresas ya no pueden fijarse solo en los resultados de pruebas de un solo turno, sino que deben incorporar las interacciones de múltiples turnos, los flujos de trabajo agénticos y las rutas de ataque reales en su marco de gobernanza.

Sophia Rossi7 min de lectura
Modelos de IA

La verdadera ventaja competitiva de la IA ya no es el modelo, sino los datos de evaluación: la próxima ronda de competencia de la IA empresarial

Este artículo se basa en una perspectiva del sector sobre “datos de evaluación (eval data)” y analiza por qué la competencia en IA está pasando de la capacidad del modelo hacia los flujos de trabajo, el acceso de usuarios y los bucles de retroalimentación, además de debatir su impacto en la IA empresarial, los agentes de IA, las plataformas de IA y el panorama industrial.

Elena Tan10 min de lectura