Senior Research Scientist | Multimodal Systems

DeepL DeepL · AI Frontier · London, United Kingdom · Research

Senior Research Scientist to lead fine-tuning, post-training, and reinforcement learning for next-generation multimodal and vision models for document translation. This role involves developing models that reason about document layout, fusing real-world and synthetic data, and making translations steerable and adaptable. Responsibilities include driving research and development, building evaluator models, owning the full model lifecycle from prototyping to production deployment, and establishing best practices for evaluation and monitoring.

What you'd actually do

  1. Drive the development of vision and multimodal models for document, image and media translation, ranging from media ingestion and generation to end-to-end models.
  2. Drive hands-on research and development on post-training for our vision and/or multimodal models: supervised fine-tuning, knowledge distillation, preference optimization, and reinforcement learning tuned to translation quality.
  3. Build evaluator models for document and design quality, including rubric- and reference-based grading, and investigate and mitigate reward hacking and quality-estimation failure modes.
  4. Own the full lifecycle of model delivery: prototyping, ablations, training, evaluation, optimization, and production deployment, working closely with engineering to ship into real-time systems at scale.
  5. Establish strong practices for evaluation, reproducibility, monitoring, and continuous model improvement in production.

Skills

Required

  • Developing multimodal models, VLM, and/or vision models
  • Model post-training, knowledge distillation (teacher-student training), and/or reinforcement learning (RLHF/RLAIF, PPO/GSPO, and reward modeling)
  • Data-centric instincts for building synthetic-data and preference-data pipelines, Model-as-judge generation, data curation and filtering, data augmentations, and/or reasoning about data mixtures and ablations
  • Training models, running experiments, debugging pipelines, and integrating ML systems into production
  • Python, PyTorch/JAX/Tensorflow
  • Lead complex research efforts, communicate clearly and collaborate across teams

Nice to have

  • Machine translation, multilingual NLP, efficient long-context modeling, language quality estimation, or multimodal machine translation
  • Designing evaluation and reward signals using automatic metrics, Model-as-judge evaluation, non-verifiable rewards, and human-in-the-loop evaluation
  • Multi-objective optimization, consistency models, unified multimodal generation
  • Diffusion models
  • Publications at top-tier venues

What the JD emphasized

  • multimodal models
  • vision models
  • document translation
  • fine-tuning
  • reinforcement learning
  • evaluator models
  • production deployment

Other signals

  • multimodal models
  • document translation
  • fine-tuning
  • reinforcement learning
  • evaluator models
  • production deployment