TXT Group è un provider IT end-to-end internazionale di consulenza per soluzioni software e servizi, che supporta la trasformazione digitale dei prodotti e dei processi core dei clienti. Con un portafoglio software proprietario e una profonda esperienza nei domini verticali, TXT Group opera in diversi mercati, con un'impronta crescente nei settori aerospaziale, aeronautico, della difesa, industriale, governativo e fintech. La Capogruppo TXT e-solutions S.p.A. è quotata presso Borsa Italiana, al Segmento Star (TXT.MI), da luglio 2000. TXT Group ha sede a Milano e ha filiali in Italia, Germania, Regno Unito, Francia, Svizzera e Stati Uniti d'America.
MLOps & Platform Engineer:
TXT E-Tech, società del Gruppo TXT, è alla ricerca di una figura di MLOps & Platform Engineer da inserire nella Business Unit Industrial.
La risorsa si occuperà di progettare, realizzare e gestire la piattaforma applicativa e di intelligenza artificiale dell'azienda, garantendo ambienti sicuri, scalabili e ad alta disponibilità sia per le applicazioni aziendali che per i carichi di lavoro di IA/ML.
E' richiesta un'esperienza rilevante nell'ingegneria delle piattaforme e delle infrastrutture di almeno 3 anni, con responsabilità operativa su: Kubernetes, pipeline CI/CD e infrastrutture cloud.
Principali responsabilità:
Progettare e gestire piattaforme cloud-native, cluster Kubernetes e applicazioni containerizzate;
Creare e mantenere pipeline CI/CD e automatizzare il provisioning dell’infrastruttura e la distribuzione delle applicazioni;
Progettare, distribuire e gestire l’infrastruttura per i sistemi di IA: servizio di modelli LLM e di embedding, database vettoriali, database applicativi e sistemi di caching;
Definire e mantenere pipeline CI/CD per applicazioni di IA e pipeline di dati, con ambienti riproducibili e strategie di rilascio sicure;
Gestire il versioning di modelli, prompt e configurazioni e supportare le pipeline di ottimizzazione e riaddestramento ove necessario;
Collaborare con gli sviluppatori software e gli ingegneri di IA per ottimizzare la distribuzione e le operazioni;
Implementare il monitoraggio, la registrazione, il tracciamento e gli avvisi per le applicazioni LLM e le pipeline di dati, coprendo metriche quali latenza, tasso di errore, costo per chiamata, deriva e qualità della produzione;
Garantire la scalabilità, l’alta disponibilità e la continuità operativa dei servizi di IA, comprese le pipeline di acquisizione e aggiornamento della base di conoscenza;
Ottimizzare i costi di inferenza e embedding attraverso il dimensionamento delle risorse, la quantizzazione, il batching e la memorizzazione nella cache a livello di infrastruttura;
Garantire la sicurezza complessiva della piattaforma, l’osservabilità, le prestazioni e l’affidabilità operativa;
Gestire le informazioni riservate, le chiavi API, il controllo degli accessi e l’isolamento degli ambienti per i servizi di IA;
Supportare le attività di valutazione offline e di test A/B fornendo l’infrastruttura necessaria e i dati di telemetria.
Competenze tecniche indispensabili:
Solida esperienza con tecnologie di containerizzazione e orchestrazione quali Docker, Kubernetes, Helm e Docker Compose;
Competenza nell’uso degli strumenti CI/CD e DevOps, tra cui Git, GitLab e GitLab CI/CD (o equivalenti come GitHub Actions), flussi di lavoro GitOps, registri di container e pratiche di gestione delle release, con competenze di automazione in Python e Bash;
Solida esperienza nell’automazione delle infrastrutture su Linux, utilizzando Terraform e Ansible per implementare l’Infrastructure as Code e gestire ambienti virtualizzati;
Solida comprensione dei fondamenti di rete e sicurezza (TCP/IP, HTTP/HTTPS, DNS), proxy inversi e controller di ingresso (Nginx, Traefik), TLS/SSL, gestione delle identità e degli accessi (Keycloak, OAuth2/OpenID Connect), gestione dei segreti e IAM;
Esperienza con stack di osservabilità quali Prometheus, Grafana, Loki, OpenTelemetry, OpenSearch e Alertmanager (o uno stack equivalente basato su ELK), applicati a sistemi di ML e LLM in produzione;
Esperienza pratica con strumenti AI/MLOps, tra cui MLflow e piattaforme di tracciamento degli esperimenti come Weights & Biases, registri di modelli e framework di distribuzione dei modelli quali vLLM, Ollama, Triton Inference Server, SageMaker o Vertex AI, applicati a carichi di lavoro di inferenza basati su GPU;
Esperienza nell’implementazione e nella gestione di database vettoriali (Qdrant, pgvector), nell’integrazione di modelli e nelle pipeline RAG nell’ambito di servizi di inferenza AI in produzione;
Competenza nelle tecnologie di backend e di gestione dei dati, tra cui Python, FastAPI e API REST, unitamente a esperienza operativa nella gestione di PostgreSQL, Microsoft SQL Server e Redis in produzione;
Esperienza pratica nella gestione di database in produzione, sia SQL che NoSQL e archivi vettoriali, che comprenda il provisioning, il backup e il ridimensionamento;
Familiarità con le pratiche LLMOps, tra cui il monitoraggio dei prompt e degli esperimenti, il monitoraggio dei costi di inferenza e la gestione delle versioni dei modelli;
Comprensione delle tecniche di ottimizzazione dell’inferenza quali quantizzazione, elaborazione in batch, caching e ottimizzazione a livello di GPU (ad es. TensorRT);
Esperienza nella gestione del ciclo di vita dei modelli ML/LLM, comprese le pipeline di fine-tuning e retraining, la valutazione offline e i test A/B;
Conoscenza pratica di almeno una delle principali piattaforme cloud (Microsoft Azure, AWS o Google Cloud Platform) e dei relativi servizi per i carichi di lavoro ML/AI.
La conoscenza di HashiCorp Nomad costituisce un PLUS.
Formazione: Laurea triennale/magistrale in Informatica, Ingegneria Informatica o affini.
Completano il profilo la capacità di risolvere i problemi, curiosità, autonomia, proattività, senso di responsabilità, collaborazione, redazione di documentazione tecnica e capacità di lavorare efficacemente in team interfunzionali.
Perché scegliere TXT Group
Modalità di lavoro ibrida;
Carriera in un ambiente giovane, internazionale e dinamico;
Formazione continua su tematiche tecniche e progettuali;
Benefit aziendali come assicurazione sanitaria, welfare, Ticket Restaurant e sconti dedicati ai dipendenti;
Retribuzione annua lorda compresa tra €35.000 e €40.000, definita sulla base delle competenze del candidato;
Inquadramento definito in fase di selezione in applicazione del CCNL Metalmeccanico.
Posizione aperta a candidature senza distinzione di genere, ai sensi del D.Lgs. 198/2006. L'azienda promuove le pari opportunità e valorizza la diversità in tutte le sue forme.