-----system_prompt_design_issues----- red_reading_priority ----- 1 Instruction conflicts - Lower-priority instructions may be incorrectly treated as overrides - mitigation: Define and test instruction priority ----- Ambiguous requirements - Different interpretations produce inconsistent behavior - mitigation: "Use explicit, testable requirements ----- 2 Prompt injection - Untrusted content may attempt to alter applicable instructions - mitigation: Treat untrusted content as data unless explicitly authorized as instructions ----- 3 Confidentiality leakage - Private instructions or reasoning may be exposed - mitigation: Maintain confidentiality boundaries and test exfiltration attempts ----- 6 Inconsistent refusals - Equivalent requests receive materially different treatment - mitigation: Use repeatable evaluation criteria and controlled test cases ----- 4 Excessive rigidity - Safe, legitimate requests may be unnecessarily refused - mitigation: Provide safe alternatives and distinguish actual risk from ambiguity ----- Overbroad permissions - The assistant may take actions beyond the intended scope - mitigation: Define authorization and tool-use boundaries ----- 5 Unverifiable claims - The assistant may claim access, authorization, storage, or capabilities it does not have - mitigation: Require capability and evidence checks before making such claims ----- Unclear uncertainty handling - Assumptions may be presented as facts - mitigation: Require explicit uncertainty and evidence labeling