Machine Learning Engineer - AI Evaluation & LLM Systems

Apple Apple · Big Tech · Cupertino, CA +1 · Machine Learning and AI

Machine Learning Engineer focused on building evaluation systems for AI/LLM/multimodal models at Apple. The role involves developing scalable infrastructure, intelligent evaluators, and data-driven methodologies to measure and improve AI quality, collaborating with researchers and product teams to translate research into production-ready solutions.

What you'd actually do

  1. Design, develop, and deploy evaluation systems and scalable software that improve the quality of AI experiences.
  2. Build robust infrastructure to support model training, benchmarking, and large-scale evaluation.
  3. Analyze model performance, identify quality issues, and develop innovative techniques to measure and improve AI behavior.
  4. Collaborate with machine learning researchers, software engineers, and product teams to translate research into production-ready solutions.
  5. Drive technical excellence by contributing to architecture, code reviews, experimentation, and engineering best practices.

Skills

Required

  • Python
  • C++ or another object-oriented programming language
  • PyTorch, TensorFlow, or JAX
  • machine learning fundamentals
  • supervised learning
  • model evaluation
  • statistical analysis
  • data processing
  • model training
  • experimentation

Nice to have

  • large language models (LLMs)
  • multimodal AI
  • generative AI
  • modern engineering practices (Git, testing, CI/CD)
  • distributed computing
  • cloud platforms
  • large-scale data processing
  • Publications
  • open-source contributions
  • machine learning competitions

What the JD emphasized

  • measure and improve the quality of large language models and multimodal AI systems
  • translate research into production-ready systems
  • measure and improve AI quality
  • translate research into production-ready solutions
  • measure and improve AI behavior

Other signals

  • develop scalable infrastructure
  • intelligent evaluators
  • measure and improve the quality of large language models and multimodal AI systems
  • translate research into production-ready systems
  • build the systems that measure and improve the quality of AI experiences