Cyber Digital Trust & Online Safety Manager

This role focuses on evaluating and ensuring the safety and trustworthiness of generative AI outputs by designing testing scenarios, researching adversarial techniques, assessing content moderation effectiveness, and recommending improvements. It involves developing multimodal test content and prompt manipulation methods to identify failure modes in AI models.

What you'd actually do

  1. Designing and executing testing scenarios to identify how prompts or user inputs could be manipulated to generate harmful, misleading, or misaligned generative artificial intelligence outputs.
  2. Researching emerging prompt injection, jailbreak, and adversarial testing techniques to evaluate model weaknesses, bias, factual inaccuracy, and misalignment with user intent.
  3. Assessing the effectiveness of content moderation systems in detecting unsafe outputs and documenting vulnerabilities, failure patterns, and potential misuse impacts.
  4. Recommending improvements to moderation policies, flagging mechanisms, training data, and governance controls based on testing findings.
  5. Collaborating with generative artificial intelligence development, content moderation, and cross-functional stakeholders to strengthen security, trust, safety, and responsible use outcomes.

Skills

Required

  • Master’s degree in Computer Science, Artificial Intelligence, Machine Learning, Data Science, Cybersecurity, Linguistics, Psychology, or a related field, or equivalent professional experience
  • 10+ years of experience in threat modeling and simulation, prompt generation and analysis, novel testing, and reporting and improvement
  • Demonstrated hands-on experience, portfolio work, publications, or research in prompt injection, jailbreak testing, model evaluation, adversarial machine learning, multimodal artificial intelligence safety, or generative artificial intelligence vulnerability assessment
  • Ability to travel 25-50%, on average, based on the work you do and the clients and industries/sectors you serve.

Nice to have

  • Doctor of Philosophy (PhD) in Computer Science, Artificial Intelligence, Machine Learning, Data Science, Cybersecurity, Linguistics, Psychology, or a related field, or equivalent professional experience
  • Specialized training or certifications in generative artificial intelligence red teaming, adversarial machine learning, artificial intelligence security, cybersecurity, responsible artificial intelligence, or artificial intelligence governance

What the JD emphasized

  • prompt injection
  • jailbreak
  • adversarial testing
  • model weaknesses
  • bias
  • factual inaccuracy
  • misalignment
  • unsafe outputs
  • vulnerabilities
  • failure patterns
  • misuse impacts
  • moderation policies
  • flagging mechanisms
  • training data
  • governance controls
  • generative artificial intelligence development
  • content moderation
  • cross-functional stakeholders
  • security
  • trust
  • safety
  • responsible use
  • multimodal test content
  • novel prompt manipulation methods
  • failure modes
  • text
  • model inputs
  • threat modeling and simulation
  • prompt generation and analysis
  • novel testing
  • reporting and improvement
  • prompt injection
  • jailbreak testing
  • model evaluation
  • adversarial machine learning
  • multimodal artificial intelligence safety
  • generative artificial intelligence vulnerability assessment
  • generative artificial intelligence red teaming
  • adversarial machine learning
  • artificial intelligence security
  • responsible artificial intelligence
  • artificial intelligence governance

Other signals

  • evaluating model weaknesses
  • assessing effectiveness of content moderation systems
  • recommending improvements to moderation policies
  • collaborating with generative artificial intelligence development
  • developing multimodal test content and novel prompt manipulation methods