Anthropic ha desarrollado un modelo de IA denominado Model 2 que supera en capacidad a Mythos 5 y ofrece una "mejora apreciable" en múltiples tareas internas, según reportó la compañía. El modelo no está disponible públicamente, aunque ya se utiliza de forma intensiva dentro de los flujos de trabajo empresariales de Anthropic, particularmente en ingeniería de software, programación y generación de datos.
La compañía indicó que Claude ya redacta la mayoría del código que se fusiona en los repositorios de producción de Anthropic. Sin embargo, los responsables del modelo consideran que es demasiado potente para lanzarlo públicamente, una decisión que refleja una tendencia más amplia en el sector de la IA de evaluar cuidadosamente antes de desplegar nuevos sistemas.
Durante la fase de aprobación interna, Anthropic no encontró que Model 2 tuviera peor alineamiento que Mythos 5. No obstante, la evaluación general de riesgo de desalineamiento en situaciones de alto impacto pasó de "muy bajo" a "bajo", en parte por la incertidumbre generada por recientes escándalos de ciberseguridad en modelos de Anthropic y OpenAI, según reportó la empresa.
Anthropic reconoció también que tiene menos confianza que antes a la hora de extraer conclusiones sobre los riesgos de estos nuevos modelos, ya que varias evaluaciones específicas están saturadas: los modelos han mejorado tanto que esos estándares de referencia ya no son tan útiles. La empresa no ejecutó su batería completa de pruebas en Model 2 porque no pretende lanzarlo públicamente.
La tendencia de retener modelos avanzados se extiende más allá de Anthropic. OpenAI también está retrasando su modelo de próxima generación, Astra, porque no ha podido descartar que sea demasiado capaz en ciberseguridad. Las startups de IA están entrando en una fase en la que entrenan un modelo y luego evalúan si conviene publicarlo, una práctica que contrasta con el enfoque anterior de lanzar cada nuevo modelo desarrollado.



