Plataforma de inferencia de IA especializada en servir modelos de pesos abiertos con baja latencia.
Ejecuta modelos abiertos mediante un motor de inferencia optimizado a medida, con técnicas como el batching continuo y la decodificación especulativa, lo que la hace muy adecuada para cargas de producción sensibles a la latencia.
© 2026 ITBGM