Since I'm obliged to work with a development OS that currently doesn't

[oota-llvm.git] / lib / Target / X86 / X86InstrSSE.td
diff --git a/lib/Target/X86/X86InstrSSE.td b/lib/Target/X86/X86InstrSSE.td

index 58e923d6df5c82e0c47d8108fb5fbce0f9ccbbef..4fc1044cba96451521dfec2fdcb10c43f3e78640 100644 (file)
--- a/lib/Target/X86/X86InstrSSE.td
+++ b/lib/Target/X86/X86InstrSSE.td
@@ -315,7 +315,7 @@ let Uses = [EFLAGS], usesCustomDAGSchedInserter = 1 in {
  let neverHasSideEffects = 1 in
  def MOVSSrr : SSI<0x10, MRMSrcReg, (outs FR32:$dst), (ins FR32:$src),
                    "movss\t{$src, $dst|$dst, $src}", []>;
-let isSimpleLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
+let canFoldAsLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
  def MOVSSrm : SSI<0x10, MRMSrcMem, (outs FR32:$dst), (ins f32mem:$src),
                    "movss\t{$src, $dst|$dst, $src}",
                    [(set FR32:$dst, (loadf32 addr:$src))]>;
@@ -398,12 +398,11 @@ let Constraints = "$src1 = $dst" in {
  }
  
  // Comparison instructions
-let Constraints = "$src1 = $dst" in {
-let neverHasSideEffects = 1 in
+let Constraints = "$src1 = $dst", neverHasSideEffects = 1 in {
    def CMPSSrr : SSIi8<0xC2, MRMSrcReg, 
                      (outs FR32:$dst), (ins FR32:$src1, FR32:$src, SSECC:$cc),
                      "cmp${cc}ss\t{$src, $dst|$dst, $src}", []>;
-let neverHasSideEffects = 1, mayLoad = 1 in
+let mayLoad = 1 in
    def CMPSSrm : SSIi8<0xC2, MRMSrcMem, 
                      (outs FR32:$dst), (ins FR32:$src1, f32mem:$src, SSECC:$cc),
                      "cmp${cc}ss\t{$src, $dst|$dst, $src}", []>;
@@ -434,24 +433,20 @@ let Constraints = "$src1 = $dst" in {
  }
  
  let Defs = [EFLAGS] in {
-def Int_UCOMISSrr: PSI<0x2E, MRMSrcReg, (outs),
-                                            (ins VR128:$src1, VR128:$src2),
+def Int_UCOMISSrr: PSI<0x2E, MRMSrcReg, (outs), (ins VR128:$src1, VR128:$src2),
                         "ucomiss\t{$src2, $src1|$src1, $src2}",
                         [(X86ucomi (v4f32 VR128:$src1), VR128:$src2),
                          (implicit EFLAGS)]>;
-def Int_UCOMISSrm: PSI<0x2E, MRMSrcMem, (outs),
-                                            (ins VR128:$src1, f128mem:$src2),
+def Int_UCOMISSrm: PSI<0x2E, MRMSrcMem, (outs),(ins VR128:$src1, f128mem:$src2),
                         "ucomiss\t{$src2, $src1|$src1, $src2}",
                         [(X86ucomi (v4f32 VR128:$src1), (load addr:$src2)),
                          (implicit EFLAGS)]>;
  
-def Int_COMISSrr: PSI<0x2F, MRMSrcReg, (outs),
-                                           (ins VR128:$src1, VR128:$src2),
+def Int_COMISSrr: PSI<0x2F, MRMSrcReg, (outs), (ins VR128:$src1, VR128:$src2),
                        "comiss\t{$src2, $src1|$src1, $src2}",
                        [(X86comi (v4f32 VR128:$src1), VR128:$src2),
                         (implicit EFLAGS)]>;
-def Int_COMISSrm: PSI<0x2F, MRMSrcMem, (outs),
-                                           (ins VR128:$src1, f128mem:$src2),
+def Int_COMISSrm: PSI<0x2F, MRMSrcMem, (outs), (ins VR128:$src1, f128mem:$src2),
                        "comiss\t{$src2, $src1|$src1, $src2}",
                        [(X86comi (v4f32 VR128:$src1), (load addr:$src2)),
                         (implicit EFLAGS)]>;
@@ -474,7 +469,7 @@ def FsMOVAPSrr : PSI<0x28, MRMSrcReg, (outs FR32:$dst), (ins FR32:$src),
  
  // Alias instruction to load FR32 from f128mem using movaps. Upper bits are
  // disregarded.
-let isSimpleLoad = 1 in
+let canFoldAsLoad = 1 in
  def FsMOVAPSrm : PSI<0x28, MRMSrcMem, (outs FR32:$dst), (ins f128mem:$src),
                       "movaps\t{$src, $dst|$dst, $src}",
                       [(set FR32:$dst, (alignedloadfsf32 addr:$src))]>;
@@ -482,34 +477,40 @@ def FsMOVAPSrm : PSI<0x28, MRMSrcMem, (outs FR32:$dst), (ins f128mem:$src),
  // Alias bitwise logical operations using SSE logical ops on packed FP values.
  let Constraints = "$src1 = $dst" in {
  let isCommutable = 1 in {
-  def FsANDPSrr : PSI<0x54, MRMSrcReg, (outs FR32:$dst), (ins FR32:$src1, FR32:$src2),
+  def FsANDPSrr : PSI<0x54, MRMSrcReg, (outs FR32:$dst),
+                                       (ins FR32:$src1, FR32:$src2),
                        "andps\t{$src2, $dst|$dst, $src2}",
                        [(set FR32:$dst, (X86fand FR32:$src1, FR32:$src2))]>;
-  def FsORPSrr  : PSI<0x56, MRMSrcReg, (outs FR32:$dst), (ins FR32:$src1, FR32:$src2),
+  def FsORPSrr  : PSI<0x56, MRMSrcReg, (outs FR32:$dst),
+                                       (ins FR32:$src1, FR32:$src2),
                        "orps\t{$src2, $dst|$dst, $src2}",
                        [(set FR32:$dst, (X86for FR32:$src1, FR32:$src2))]>;
-  def FsXORPSrr : PSI<0x57, MRMSrcReg, (outs FR32:$dst), (ins FR32:$src1, FR32:$src2),
+  def FsXORPSrr : PSI<0x57, MRMSrcReg, (outs FR32:$dst),
+                                       (ins FR32:$src1, FR32:$src2),
                        "xorps\t{$src2, $dst|$dst, $src2}",
                        [(set FR32:$dst, (X86fxor FR32:$src1, FR32:$src2))]>;
  }
  
-def FsANDPSrm : PSI<0x54, MRMSrcMem, (outs FR32:$dst), (ins FR32:$src1, f128mem:$src2),
+def FsANDPSrm : PSI<0x54, MRMSrcMem, (outs FR32:$dst),
+                                     (ins FR32:$src1, f128mem:$src2),
                      "andps\t{$src2, $dst|$dst, $src2}",
                      [(set FR32:$dst, (X86fand FR32:$src1,
                                        (memopfsf32 addr:$src2)))]>;
-def FsORPSrm  : PSI<0x56, MRMSrcMem, (outs FR32:$dst), (ins FR32:$src1, f128mem:$src2),
+def FsORPSrm  : PSI<0x56, MRMSrcMem, (outs FR32:$dst),
+                                     (ins FR32:$src1, f128mem:$src2),
                      "orps\t{$src2, $dst|$dst, $src2}",
                      [(set FR32:$dst, (X86for FR32:$src1,
                                        (memopfsf32 addr:$src2)))]>;
-def FsXORPSrm : PSI<0x57, MRMSrcMem, (outs FR32:$dst), (ins FR32:$src1, f128mem:$src2),
+def FsXORPSrm : PSI<0x57, MRMSrcMem, (outs FR32:$dst),
+                                     (ins FR32:$src1, f128mem:$src2),
                      "xorps\t{$src2, $dst|$dst, $src2}",
                      [(set FR32:$dst, (X86fxor FR32:$src1,
                                        (memopfsf32 addr:$src2)))]>;
+
  let neverHasSideEffects = 1 in {
  def FsANDNPSrr : PSI<0x55, MRMSrcReg,
                       (outs FR32:$dst), (ins FR32:$src1, FR32:$src2),
                       "andnps\t{$src2, $dst|$dst, $src2}", []>;
-                     
  let mayLoad = 1 in
  def FsANDNPSrm : PSI<0x55, MRMSrcMem,
                       (outs FR32:$dst), (ins FR32:$src1, f128mem:$src2),
@@ -667,7 +668,7 @@ defm MIN : sse1_fp_binop_rm<0x5D, "min", X86fmin,
  let neverHasSideEffects = 1 in 
  def MOVAPSrr : PSI<0x28, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src),
                     "movaps\t{$src, $dst|$dst, $src}", []>;
-let isSimpleLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
+let canFoldAsLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
  def MOVAPSrm : PSI<0x28, MRMSrcMem, (outs VR128:$dst), (ins f128mem:$src),
                     "movaps\t{$src, $dst|$dst, $src}",
                     [(set VR128:$dst, (alignedloadv4f32 addr:$src))]>;
@@ -679,7 +680,7 @@ def MOVAPSmr : PSI<0x29, MRMDestMem, (outs), (ins f128mem:$dst, VR128:$src),
  let neverHasSideEffects = 1 in
  def MOVUPSrr : PSI<0x10, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src),
                     "movups\t{$src, $dst|$dst, $src}", []>;
-let isSimpleLoad = 1 in
+let canFoldAsLoad = 1 in
  def MOVUPSrm : PSI<0x10, MRMSrcMem, (outs VR128:$dst), (ins f128mem:$src),
                     "movups\t{$src, $dst|$dst, $src}",
                     [(set VR128:$dst, (loadv4f32 addr:$src))]>;
@@ -688,7 +689,7 @@ def MOVUPSmr : PSI<0x11, MRMDestMem, (outs), (ins f128mem:$dst, VR128:$src),
                     [(store (v4f32 VR128:$src), addr:$dst)]>;
  
  // Intrinsic forms of MOVUPS load and store
-let isSimpleLoad = 1 in
+let canFoldAsLoad = 1 in
  def MOVUPSrm_Int : PSI<0x10, MRMSrcMem, (outs VR128:$dst), (ins f128mem:$src),
                         "movups\t{$src, $dst|$dst, $src}",
                         [(set VR128:$dst, (int_x86_sse_loadu_ps addr:$src))]>;
@@ -987,9 +988,9 @@ def STMXCSR : PSI<0xAE, MRM3m, (outs), (ins i32mem:$dst),
                    "stmxcsr\t$dst", [(int_x86_sse_stmxcsr addr:$dst)]>;
  
  // Alias instructions that map zero vector to pxor / xorp* for sse.
-// We set isSimpleLoad because this can be converted to a constant-pool
+// We set canFoldAsLoad because this can be converted to a constant-pool
  // load of an all-zeros value if folding it would be beneficial.
-let isReMaterializable = 1, isAsCheapAsAMove = 1, isSimpleLoad = 1 in
+let isReMaterializable = 1, isAsCheapAsAMove = 1, canFoldAsLoad = 1 in
  def V_SET0 : PSI<0x57, MRMInitReg, (outs VR128:$dst), (ins),
                   "xorps\t$dst, $dst",
                   [(set VR128:$dst, (v4i32 immAllZerosV))]>;
@@ -1063,7 +1064,7 @@ def : Pat<(v4f32 (X86vzmovl (loadv4f32 addr:$src))),
  let neverHasSideEffects = 1 in
  def MOVSDrr : SDI<0x10, MRMSrcReg, (outs FR64:$dst), (ins FR64:$src),
                    "movsd\t{$src, $dst|$dst, $src}", []>;
-let isSimpleLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
+let canFoldAsLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
  def MOVSDrm : SDI<0x10, MRMSrcMem, (outs FR64:$dst), (ins f64mem:$src),
                    "movsd\t{$src, $dst|$dst, $src}",
                    [(set FR64:$dst, (loadf64 addr:$src))]>;
@@ -1162,7 +1163,7 @@ def UCOMISDrm: PDI<0x2E, MRMSrcMem, (outs), (ins FR64:$src1, f64mem:$src2),
                     "ucomisd\t{$src2, $src1|$src1, $src2}",
                     [(X86cmp FR64:$src1, (loadf64 addr:$src2)),
                      (implicit EFLAGS)]>;
-}
+} // Defs = [EFLAGS]
  
  // Aliases to match intrinsics which expect XMM operand(s).
  let Constraints = "$src1 = $dst" in {
@@ -1196,7 +1197,7 @@ def Int_COMISDrm: PDI<0x2F, MRMSrcMem, (outs), (ins VR128:$src1, f128mem:$src2),
                        "comisd\t{$src2, $src1|$src1, $src2}",
                        [(X86comi (v2f64 VR128:$src1), (load addr:$src2)),
                         (implicit EFLAGS)]>;
-} // Defs = EFLAGS]
+} // Defs = [EFLAGS]
  
  // Aliases of packed SSE2 instructions for scalar use. These all have names that
  // start with 'Fs'.
@@ -1215,7 +1216,7 @@ def FsMOVAPDrr : PDI<0x28, MRMSrcReg, (outs FR64:$dst), (ins FR64:$src),
  
  // Alias instruction to load FR64 from f128mem using movapd. Upper bits are
  // disregarded.
-let isSimpleLoad = 1 in
+let canFoldAsLoad = 1 in
  def FsMOVAPDrm : PDI<0x28, MRMSrcMem, (outs FR64:$dst), (ins f128mem:$src),
                       "movapd\t{$src, $dst|$dst, $src}",
                       [(set FR64:$dst, (alignedloadfsf64 addr:$src))]>;
@@ -1286,31 +1287,36 @@ multiclass basic_sse2_fp_binop_rm<bits<8> opc, string OpcodeStr,
    }
  
    // Scalar operation, reg+mem.
-  def SDrm : SDI<opc, MRMSrcMem, (outs FR64:$dst), (ins FR64:$src1, f64mem:$src2),
+  def SDrm : SDI<opc, MRMSrcMem, (outs FR64:$dst),
+                                 (ins FR64:$src1, f64mem:$src2),
                   !strconcat(OpcodeStr, "sd\t{$src2, $dst|$dst, $src2}"),
                   [(set FR64:$dst, (OpNode FR64:$src1, (load addr:$src2)))]>;
                   
    // Vector operation, reg+reg.
-  def PDrr : PDI<opc, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src1, VR128:$src2),
+  def PDrr : PDI<opc, MRMSrcReg, (outs VR128:$dst),
+                                 (ins VR128:$src1, VR128:$src2),
                 !strconcat(OpcodeStr, "pd\t{$src2, $dst|$dst, $src2}"),
                 [(set VR128:$dst, (v2f64 (OpNode VR128:$src1, VR128:$src2)))]> {
      let isCommutable = Commutable;
    }
  
    // Vector operation, reg+mem.
-  def PDrm : PDI<opc, MRMSrcMem, (outs VR128:$dst), (ins VR128:$src1, f128mem:$src2),
+  def PDrm : PDI<opc, MRMSrcMem, (outs VR128:$dst),
+                                 (ins VR128:$src1, f128mem:$src2),
                   !strconcat(OpcodeStr, "pd\t{$src2, $dst|$dst, $src2}"),
-                 [(set VR128:$dst, (OpNode VR128:$src1, (memopv2f64 addr:$src2)))]>;
+             [(set VR128:$dst, (OpNode VR128:$src1, (memopv2f64 addr:$src2)))]>;
  
    // Intrinsic operation, reg+reg.
-  def SDrr_Int : SDI<opc, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src1, VR128:$src2),
+  def SDrr_Int : SDI<opc, MRMSrcReg, (outs VR128:$dst),
+                                     (ins VR128:$src1, VR128:$src2),
                       !strconcat(OpcodeStr, "sd\t{$src2, $dst|$dst, $src2}"),
                       [(set VR128:$dst, (F64Int VR128:$src1, VR128:$src2))]> {
      let isCommutable = Commutable;
    }
  
    // Intrinsic operation, reg+mem.
-  def SDrm_Int : SDI<opc, MRMSrcMem, (outs VR128:$dst), (ins VR128:$src1, sdmem:$src2),
+  def SDrm_Int : SDI<opc, MRMSrcMem, (outs VR128:$dst),
+                                     (ins VR128:$src1, sdmem:$src2),
                       !strconcat(OpcodeStr, "sd\t{$src2, $dst|$dst, $src2}"),
                       [(set VR128:$dst, (F64Int VR128:$src1,
                                                 sse_load_f64:$src2))]>;
@@ -1410,7 +1416,7 @@ defm MIN : sse2_fp_binop_rm<0x5D, "min", X86fmin,
  let neverHasSideEffects = 1 in
  def MOVAPDrr : PDI<0x28, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src),
                     "movapd\t{$src, $dst|$dst, $src}", []>;
-let isSimpleLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
+let canFoldAsLoad = 1, isReMaterializable = 1, mayHaveSideEffects = 1 in
  def MOVAPDrm : PDI<0x28, MRMSrcMem, (outs VR128:$dst), (ins f128mem:$src),
                     "movapd\t{$src, $dst|$dst, $src}",
                     [(set VR128:$dst, (alignedloadv2f64 addr:$src))]>;
@@ -1422,7 +1428,7 @@ def MOVAPDmr : PDI<0x29, MRMDestMem, (outs), (ins f128mem:$dst, VR128:$src),
  let neverHasSideEffects = 1 in
  def MOVUPDrr : PDI<0x10, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src),
                     "movupd\t{$src, $dst|$dst, $src}", []>;
-let isSimpleLoad = 1 in
+let canFoldAsLoad = 1 in
  def MOVUPDrm : PDI<0x10, MRMSrcMem, (outs VR128:$dst), (ins f128mem:$src),
                     "movupd\t{$src, $dst|$dst, $src}",
                     [(set VR128:$dst, (loadv2f64 addr:$src))]>;
@@ -1790,7 +1796,7 @@ let Constraints = "$src1 = $dst" in {
  let neverHasSideEffects = 1 in
  def MOVDQArr : PDI<0x6F, MRMSrcReg, (outs VR128:$dst), (ins VR128:$src),
                     "movdqa\t{$src, $dst|$dst, $src}", []>;
-let isSimpleLoad = 1, mayLoad = 1 in
+let canFoldAsLoad = 1, mayLoad = 1 in
  def MOVDQArm : PDI<0x6F, MRMSrcMem, (outs VR128:$dst), (ins i128mem:$src),
                     "movdqa\t{$src, $dst|$dst, $src}",
                     [/*(set VR128:$dst, (alignedloadv2i64 addr:$src))*/]>;
@@ -1798,7 +1804,7 @@ let mayStore = 1 in
  def MOVDQAmr : PDI<0x7F, MRMDestMem, (outs), (ins i128mem:$dst, VR128:$src),
                     "movdqa\t{$src, $dst|$dst, $src}",
                     [/*(alignedstore (v2i64 VR128:$src), addr:$dst)*/]>;
-let isSimpleLoad = 1, mayLoad = 1 in
+let canFoldAsLoad = 1, mayLoad = 1 in
  def MOVDQUrm :   I<0x6F, MRMSrcMem, (outs VR128:$dst), (ins i128mem:$src),
                     "movdqu\t{$src, $dst|$dst, $src}",
                     [/*(set VR128:$dst, (loadv2i64 addr:$src))*/]>,
@@ -1810,7 +1816,7 @@ def MOVDQUmr :   I<0x7F, MRMDestMem, (outs), (ins i128mem:$dst, VR128:$src),
                   XS, Requires<[HasSSE2]>;
  
  // Intrinsic forms of MOVDQU load and store
-let isSimpleLoad = 1 in
+let canFoldAsLoad = 1 in
  def MOVDQUrm_Int :   I<0x6F, MRMSrcMem, (outs VR128:$dst), (ins i128mem:$src),
                         "movdqu\t{$src, $dst|$dst, $src}",
                         [(set VR128:$dst, (int_x86_sse2_loadu_dq addr:$src))]>,
@@ -2255,9 +2261,9 @@ def : Pat<(membarrier (i8 imm:$ll), (i8 imm:$ls), (i8 imm:$sl), (i8 imm:$ss),
             (i8 1)), (MFENCE)>;
  
  // Alias instructions that map zero vector to pxor / xorp* for sse.
-// We set isSimpleLoad because this can be converted to a constant-pool
+// We set canFoldAsLoad because this can be converted to a constant-pool
  // load of an all-ones value if folding it would be beneficial.
-let isReMaterializable = 1, isAsCheapAsAMove = 1, isSimpleLoad = 1 in
+let isReMaterializable = 1, isAsCheapAsAMove = 1, canFoldAsLoad = 1 in
    def V_SETALLONES : PDI<0x76, MRMInitReg, (outs VR128:$dst), (ins),
                           "pcmpeqd\t$dst, $dst",
                           [(set VR128:$dst, (v4i32 immAllOnesV))]>;
@@ -3013,62 +3019,60 @@ def : Pat<(v4i32 (vector_shuffle VR128:$src1, (undef),
  let AddedComplexity = 20 in {
  // vector_shuffle v1, (load v2) <4, 5, 2, 3> using MOVLPS
  // vector_shuffle v1, (load v2) <0, 1, 4, 5> using MOVHPS
-def : Pat<(v4f32 (vector_shuffle VR128:$src1, (memop addr:$src2),
+def : Pat<(v4f32 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVLP_shuffle_mask)),
            (MOVLPSrm VR128:$src1, addr:$src2)>, Requires<[HasSSE1]>;
-def : Pat<(v2f64 (vector_shuffle VR128:$src1, (memop addr:$src2),
+def : Pat<(v2f64 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVLP_shuffle_mask)),
            (MOVLPDrm VR128:$src1, addr:$src2)>, Requires<[HasSSE2]>;
-def : Pat<(v4f32 (vector_shuffle VR128:$src1, (memop addr:$src2),
+def : Pat<(v4f32 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVHP_shuffle_mask)),
            (MOVHPSrm VR128:$src1, addr:$src2)>, Requires<[HasSSE1]>;
-def : Pat<(v2f64 (vector_shuffle VR128:$src1, (memop addr:$src2),
+def : Pat<(v2f64 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVHP_shuffle_mask)),
            (MOVHPDrm VR128:$src1, addr:$src2)>, Requires<[HasSSE2]>;
  
-def : Pat<(v4i32 (vector_shuffle VR128:$src1,
-                                 (bc_v4i32 (memopv2i64 addr:$src2)),
+def : Pat<(v4i32 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVLP_shuffle_mask)),
            (MOVLPSrm VR128:$src1, addr:$src2)>, Requires<[HasSSE2]>;
-def : Pat<(v2i64 (vector_shuffle VR128:$src1, (memop addr:$src2),
+def : Pat<(v2i64 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVLP_shuffle_mask)),
            (MOVLPDrm VR128:$src1, addr:$src2)>, Requires<[HasSSE2]>;
-def : Pat<(v4i32 (vector_shuffle VR128:$src1,
-                                 (bc_v4i32 (memopv2i64 addr:$src2)),
+def : Pat<(v4i32 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVHP_shuffle_mask)),
            (MOVHPSrm VR128:$src1, addr:$src2)>, Requires<[HasSSE1]>;
-def : Pat<(v2i64 (vector_shuffle VR128:$src1, (memop addr:$src2),
+def : Pat<(v2i64 (vector_shuffle VR128:$src1, (load addr:$src2),
                    MOVHP_shuffle_mask)),
            (MOVHPDrm VR128:$src1, addr:$src2)>, Requires<[HasSSE2]>;
  }
  
  // (store (vector_shuffle (load addr), v2, <4, 5, 2, 3>), addr) using MOVLPS
  // (store (vector_shuffle (load addr), v2, <0, 1, 4, 5>), addr) using MOVHPS
-def : Pat<(store (v4f32 (vector_shuffle (memop addr:$src1), VR128:$src2,
+def : Pat<(store (v4f32 (vector_shuffle (load addr:$src1), VR128:$src2,
                           MOVLP_shuffle_mask)), addr:$src1),
            (MOVLPSmr addr:$src1, VR128:$src2)>, Requires<[HasSSE1]>;
-def : Pat<(store (v2f64 (vector_shuffle (memop addr:$src1), VR128:$src2,
+def : Pat<(store (v2f64 (vector_shuffle (load addr:$src1), VR128:$src2,
                           MOVLP_shuffle_mask)), addr:$src1),
            (MOVLPDmr addr:$src1, VR128:$src2)>, Requires<[HasSSE2]>;
-def : Pat<(store (v4f32 (vector_shuffle (memop addr:$src1), VR128:$src2,
+def : Pat<(store (v4f32 (vector_shuffle (load addr:$src1), VR128:$src2,
                           MOVHP_shuffle_mask)), addr:$src1),
            (MOVHPSmr addr:$src1, VR128:$src2)>, Requires<[HasSSE1]>;
-def : Pat<(store (v2f64 (vector_shuffle (memop addr:$src1), VR128:$src2,
+def : Pat<(store (v2f64 (vector_shuffle (load addr:$src1), VR128:$src2,
                           MOVHP_shuffle_mask)), addr:$src1),
            (MOVHPDmr addr:$src1, VR128:$src2)>, Requires<[HasSSE2]>;
  
  def : Pat<(store (v4i32 (vector_shuffle
-                         (bc_v4i32 (memopv2i64 addr:$src1)), VR128:$src2,
+                         (bc_v4i32 (loadv2i64 addr:$src1)), VR128:$src2,
                           MOVLP_shuffle_mask)), addr:$src1),
            (MOVLPSmr addr:$src1, VR128:$src2)>, Requires<[HasSSE1]>;
-def : Pat<(store (v2i64 (vector_shuffle (memop addr:$src1), VR128:$src2,
+def : Pat<(store (v2i64 (vector_shuffle (load addr:$src1), VR128:$src2,
                           MOVLP_shuffle_mask)), addr:$src1),
            (MOVLPDmr addr:$src1, VR128:$src2)>, Requires<[HasSSE2]>;
  def : Pat<(store (v4i32 (vector_shuffle
-                         (bc_v4i32 (memopv2i64 addr:$src1)), VR128:$src2,
+                         (bc_v4i32 (loadv2i64 addr:$src1)), VR128:$src2,
                           MOVHP_shuffle_mask)), addr:$src1),
            (MOVHPSmr addr:$src1, VR128:$src2)>, Requires<[HasSSE1]>;
-def : Pat<(store (v2i64 (vector_shuffle (memop addr:$src1), VR128:$src2,
+def : Pat<(store (v2i64 (vector_shuffle (load addr:$src1), VR128:$src2,
                           MOVHP_shuffle_mask)), addr:$src1),
            (MOVHPDmr addr:$src1, VR128:$src2)>, Requires<[HasSSE2]>;
  
@@ -3313,12 +3317,13 @@ defm PMAXUD       : SS41I_binop_rm_int<0x3F, "pmaxud",
  defm PMAXUW       : SS41I_binop_rm_int<0x3E, "pmaxuw",
                                         int_x86_sse41_pmaxuw, 1>;
  
+defm PMULDQ       : SS41I_binop_rm_int<0x28, "pmuldq", int_x86_sse41_pmuldq, 1>;
+
  def : Pat<(v2i64 (X86pcmpeqq VR128:$src1, VR128:$src2)),
            (PCMPEQQrr VR128:$src1, VR128:$src2)>;
  def : Pat<(v2i64 (X86pcmpeqq VR128:$src1, (memop addr:$src2))),
            (PCMPEQQrm VR128:$src1, addr:$src2)>;
  
-
  /// SS41I_binop_rm_int - Simple SSE 4.1 binary operator
  let Constraints = "$src1 = $dst" in {
    multiclass SS41I_binop_patint<bits<8> opc, string OpcodeStr, ValueType OpVT,
@@ -3353,9 +3358,6 @@ let Constraints = "$src1 = $dst" in {
  }
  defm PMULLD       : SS41I_binop_patint<0x40, "pmulld", v4i32, mul,
                                         int_x86_sse41_pmulld, 1>;
-defm PMULDQ       : SS41I_binop_patint<0x28, "pmuldq", v2i64, mul,
-                                       int_x86_sse41_pmuldq, 1>;
-
  
  /// SS41I_binop_rmi_int - SSE 4.1 binary operator with 8-bit immediate
  let Constraints = "$src1 = $dst" in {