x86: normalize type with _mm_cvtsi128_si32

author James Zern <jzern@google.com>

Wed, 27 Jul 2022 22:22:37 +0000 (15:22 -0700)

committer James Zern <jzern@google.com>

Wed, 27 Jul 2022 23:59:21 +0000 (16:59 -0700)
author James Zern <jzern@google.com>
Wed, 27 Jul 2022 22:22:37 +0000 (15:22 -0700)
committer James Zern <jzern@google.com>
Wed, 27 Jul 2022 23:59:21 +0000 (16:59 -0700)
diff --git a/vp8/encoder/x86/denoising_sse2.c b/vp8/encoder/x86/denoising_sse2.c

index 89cad53356737761cb66b1864f63a8b4e6a46baf..f35b93016919a3ef31bec901d6f28a36e416c490 100644 (file)
--- a/vp8/encoder/x86/denoising_sse2.c
+++ b/vp8/encoder/x86/denoising_sse2.c
@@ -30,7 +30,7 @@ static INLINE unsigned int abs_sum_diff_16x1(__m128i acc_diff) {
        _mm_add_epi32(hg_fe_dc_ba, _mm_srli_si128(hg_fe_dc_ba, 8));
    const __m128i hgfedcba =
        _mm_add_epi32(hgfe_dcba, _mm_srli_si128(hgfe_dcba, 4));
-  unsigned int sum_diff = abs(_mm_cvtsi128_si32(hgfedcba));
+  unsigned int sum_diff = (unsigned int)abs(_mm_cvtsi128_si32(hgfedcba));
  
    return sum_diff;
  }
diff --git a/vpx_dsp/x86/avg_intrin_sse2.c b/vpx_dsp/x86/avg_intrin_sse2.c

index 0c4919f6d8845ba49364aef6a04dc4201f01cad8..015c11a1f332fa144780fd2eac4f3764f1dda2d0 100644 (file)
--- a/vpx_dsp/x86/avg_intrin_sse2.c
+++ b/vpx_dsp/x86/avg_intrin_sse2.c
@@ -164,7 +164,7 @@ unsigned int vpx_highbd_avg_8x8_sse2(const uint8_t *s8, int p) {
    s0 = _mm_add_epi32(s0, s1);
    s0 = _mm_add_epi32(s0, _mm_srli_si128(s0, 8));
    s0 = _mm_add_epi32(s0, _mm_srli_si128(s0, 4));
-  avg = _mm_cvtsi128_si32(s0);
+  avg = (unsigned int)_mm_cvtsi128_si32(s0);
  
    return (avg + 32) >> 6;
  }
diff --git a/vpx_dsp/x86/convolve_avx2.h b/vpx_dsp/x86/convolve_avx2.h

index 99bc9637fcb27232e5bc763284b8563fb58e924a..ebee964b1898b518e4af848c81ae803fa77f6d81 100644 (file)
--- a/vpx_dsp/x86/convolve_avx2.h
+++ b/vpx_dsp/x86/convolve_avx2.h
@@ -129,9 +129,8 @@ static INLINE void mm256_storeu2_epi64(__m128i *const dst_ptr_1,
  static INLINE void mm256_storeu2_epi32(__m128i *const dst_ptr_1,
                                         __m128i *const dst_ptr_2,
                                         const __m256i *const src) {
-  *((uint32_t *)(dst_ptr_1)) = _mm_cvtsi128_si32(_mm256_castsi256_si128(*src));
-  *((uint32_t *)(dst_ptr_2)) =
-      _mm_cvtsi128_si32(_mm256_extractf128_si256(*src, 1));
+  *((int *)(dst_ptr_1)) = _mm_cvtsi128_si32(_mm256_castsi256_si128(*src));
+  *((int *)(dst_ptr_2)) = _mm_cvtsi128_si32(_mm256_extractf128_si256(*src, 1));
  }
  
  static INLINE __m256i mm256_round_epi32(const __m256i *const src,
diff --git a/vpx_dsp/x86/mem_sse2.h b/vpx_dsp/x86/mem_sse2.h

index 8b6d4d1dd4c9813e0a42598c14407d34a3db4548..6df4773f73af8a9e16186eaf2e39adc8192e9847 100644 (file)
--- a/vpx_dsp/x86/mem_sse2.h
+++ b/vpx_dsp/x86/mem_sse2.h
@@ -33,7 +33,7 @@ static INLINE __m128i load_unaligned_u32(const void *a) {
  }
  
  static INLINE void store_unaligned_u32(void *const a, const __m128i v) {
-  const uint32_t val = _mm_cvtsi128_si32(v);
+  const int val = _mm_cvtsi128_si32(v);
    memcpy(a, &val, sizeof(val));
  }
  
diff --git a/vpx_dsp/x86/sad_avx2.c b/vpx_dsp/x86/sad_avx2.c

index 3b48acd5109d96e0b28e93af6ab1a207597dcaff..29bedb0e6e660f25c1d3bdc246428a1c95ff00ec 100644 (file)
--- a/vpx_dsp/x86/sad_avx2.c
+++ b/vpx_dsp/x86/sad_avx2.c
@@ -14,7 +14,7 @@
  #define FSAD64_H(h)                                                           \
    unsigned int vpx_sad64x##h##_avx2(const uint8_t *src_ptr, int src_stride,   \
                                      const uint8_t *ref_ptr, int ref_stride) { \
-    int i, res;                                                               \
+    int i;                                                                    \
      __m256i sad1_reg, sad2_reg, ref1_reg, ref2_reg;                           \
      __m256i sum_sad = _mm256_setzero_si256();                                 \
      __m256i sum_sad_h;                                                        \
@@ -35,8 +35,7 @@
      sum_sad = _mm256_add_epi32(sum_sad, sum_sad_h);                           \
      sum_sad128 = _mm256_extracti128_si256(sum_sad, 1);                        \
      sum_sad128 = _mm_add_epi32(_mm256_castsi256_si128(sum_sad), sum_sad128);  \
-    res = _mm_cvtsi128_si32(sum_sad128);                                      \
-    return res;                                                               \
+    return (unsigned int)_mm_cvtsi128_si32(sum_sad128);                       \
    }
  
  #define FSAD32_H(h)                                                           \
@@ -92,7 +91,7 @@ FSAD32
    unsigned int vpx_sad64x##h##_avg_avx2(                                      \
        const uint8_t *src_ptr, int src_stride, const uint8_t *ref_ptr,         \
        int ref_stride, const uint8_t *second_pred) {                           \
-    int i, res;                                                               \
+    int i;                                                                    \
      __m256i sad1_reg, sad2_reg, ref1_reg, ref2_reg;                           \
      __m256i sum_sad = _mm256_setzero_si256();                                 \
      __m256i sum_sad_h;                                                        \
@@ -118,15 +117,14 @@ FSAD32
      sum_sad = _mm256_add_epi32(sum_sad, sum_sad_h);                           \
      sum_sad128 = _mm256_extracti128_si256(sum_sad, 1);                        \
      sum_sad128 = _mm_add_epi32(_mm256_castsi256_si128(sum_sad), sum_sad128);  \
-    res = _mm_cvtsi128_si32(sum_sad128);                                      \
-    return res;                                                               \
+    return (unsigned int)_mm_cvtsi128_si32(sum_sad128);                       \
    }
  
  #define FSADAVG32_H(h)                                                        \
    unsigned int vpx_sad32x##h##_avg_avx2(                                      \
        const uint8_t *src_ptr, int src_stride, const uint8_t *ref_ptr,         \
        int ref_stride, const uint8_t *second_pred) {                           \
-    int i, res;                                                               \
+    int i;                                                                    \
      __m256i sad1_reg, sad2_reg, ref1_reg, ref2_reg;                           \
      __m256i sum_sad = _mm256_setzero_si256();                                 \
      __m256i sum_sad_h;                                                        \
@@ -156,8 +154,7 @@ FSAD32
      sum_sad = _mm256_add_epi32(sum_sad, sum_sad_h);                           \
      sum_sad128 = _mm256_extracti128_si256(sum_sad, 1);                        \
      sum_sad128 = _mm_add_epi32(_mm256_castsi256_si128(sum_sad), sum_sad128);  \
-    res = _mm_cvtsi128_si32(sum_sad128);                                      \
-    return res;                                                               \
+    return (unsigned int)_mm_cvtsi128_si32(sum_sad128);                       \
    }
  
  #define FSADAVG64 \
diff --git a/vpx_dsp/x86/variance_sse2.c b/vpx_dsp/x86/variance_sse2.c

index a67c92aadb0d48bcf05ab7b8f19e7e2c16082f69..fedc8b84e510f640331fb1dd2e4badc7f7de62bf 100644 (file)
--- a/vpx_dsp/x86/variance_sse2.c
+++ b/vpx_dsp/x86/variance_sse2.c
@@ -19,7 +19,7 @@
  static INLINE unsigned int add32x4_sse2(__m128i val) {
    val = _mm_add_epi32(val, _mm_srli_si128(val, 8));
    val = _mm_add_epi32(val, _mm_srli_si128(val, 4));
-  return _mm_cvtsi128_si32(val);
+  return (unsigned int)_mm_cvtsi128_si32(val);
  }
  
  unsigned int vpx_get_mb_ss_sse2(const int16_t *src_ptr) {
diff --git a/vpx_dsp/x86/vpx_subpixel_4t_intrin_sse2.c b/vpx_dsp/x86/vpx_subpixel_4t_intrin_sse2.c

index 0cbd151dc3304fd2dff8993cd0b02e58c9a56da1..21a35ae3c31dccc728a564f11135040d61e1da43 100644 (file)
--- a/vpx_dsp/x86/vpx_subpixel_4t_intrin_sse2.c
+++ b/vpx_dsp/x86/vpx_subpixel_4t_intrin_sse2.c
@@ -485,7 +485,7 @@ static void vpx_filter_block1d4_h4_sse2(const uint8_t *src_ptr,
      // Saturate and convert to 8-bit words
      dst_first = _mm_packus_epi16(dst_first, _mm_setzero_si128());
  
-    *((uint32_t *)(dst_ptr)) = _mm_cvtsi128_si32(dst_first);
+    *((int *)(dst_ptr)) = _mm_cvtsi128_si32(dst_first);
  
      src_ptr += src_stride;
      dst_ptr += dst_stride;
@@ -589,8 +589,8 @@ static void vpx_filter_block1d4_v4_sse2(const uint8_t *src_ptr,
      res_reg_0123 = _mm_packus_epi16(res_reg_0123_lo, reg_zero);
  
      // Save only half of the register (8 words)
-    *((uint32_t *)(dst_ptr)) = _mm_cvtsi128_si32(res_reg_m1012);
-    *((uint32_t *)(dst_ptr + dst_stride)) = _mm_cvtsi128_si32(res_reg_0123);
+    *((int *)(dst_ptr)) = _mm_cvtsi128_si32(res_reg_m1012);
+    *((int *)(dst_ptr + dst_stride)) = _mm_cvtsi128_si32(res_reg_0123);
  
      // Update the source by two rows
      src_ptr += src_stride_unrolled;
diff --git a/vpx_dsp/x86/vpx_subpixel_8t_intrin_avx2.c b/vpx_dsp/x86/vpx_subpixel_8t_intrin_avx2.c

index 6f2983a4b5ebb1e475a5c84367a97c2dc479daa9..db3c39de0f240ba9d591f1cbbbe7171b45e6f57a 100644 (file)
--- a/vpx_dsp/x86/vpx_subpixel_8t_intrin_avx2.c
+++ b/vpx_dsp/x86/vpx_subpixel_8t_intrin_avx2.c
@@ -798,7 +798,7 @@ static void vpx_filter_block1d4_h4_avx2(const uint8_t *src_ptr,
  
      // Pack to 8-bits
      dst = _mm_packus_epi16(dst, _mm_setzero_si128());
-    *((uint32_t *)(dst_ptr)) = _mm_cvtsi128_si32(dst);
+    *((int *)(dst_ptr)) = _mm_cvtsi128_si32(dst);
    }
  }
  
diff --git a/vpx_dsp/x86/vpx_subpixel_8t_intrin_ssse3.c b/vpx_dsp/x86/vpx_subpixel_8t_intrin_ssse3.c

index ed46d6245d03dbbf8cdb4ab3c06748bc633e8397..4ea2752d38a94a1316184023cf5ac2e813834a37 100644 (file)
--- a/vpx_dsp/x86/vpx_subpixel_8t_intrin_ssse3.c
+++ b/vpx_dsp/x86/vpx_subpixel_8t_intrin_ssse3.c
@@ -580,7 +580,7 @@ static void vpx_filter_block1d4_h4_ssse3(const uint8_t *src_ptr,
  
      // Pack to 8-bits
      dst_first = _mm_packus_epi16(dst_first, _mm_setzero_si128());
-    *((uint32_t *)(dst_ptr)) = _mm_cvtsi128_si32(dst_first);
+    *((int *)(dst_ptr)) = _mm_cvtsi128_si32(dst_first);
  
      src_ptr += src_stride;
      dst_ptr += dst_stride;
@@ -666,8 +666,8 @@ static void vpx_filter_block1d4_v4_ssse3(const uint8_t *src_ptr,
      reg_1 = _mm_packus_epi16(reg_1, reg_1);
  
      // Save the result
-    *((uint32_t *)(dst_ptr)) = _mm_cvtsi128_si32(reg_0);
-    *((uint32_t *)(dst_ptr + dst_stride)) = _mm_cvtsi128_si32(reg_1);
+    *((int *)(dst_ptr)) = _mm_cvtsi128_si32(reg_0);
+    *((int *)(dst_ptr + dst_stride)) = _mm_cvtsi128_si32(reg_1);
  
      // Update the source by two rows
      src_ptr += src_stride_unrolled;
author	James Zern <jzern@google.com>
	Wed, 27 Jul 2022 22:22:37 +0000 (15:22 -0700)
committer	James Zern <jzern@google.com>
	Wed, 27 Jul 2022 23:59:21 +0000 (16:59 -0700)
vp8/encoder/x86/denoising_sse2.c		patch \| blob \| history
vpx_dsp/x86/avg_intrin_sse2.c		patch \| blob \| history
vpx_dsp/x86/convolve_avx2.h		patch \| blob \| history
vpx_dsp/x86/mem_sse2.h		patch \| blob \| history
vpx_dsp/x86/sad_avx2.c		patch \| blob \| history
vpx_dsp/x86/variance_sse2.c		patch \| blob \| history
vpx_dsp/x86/vpx_subpixel_4t_intrin_sse2.c		patch \| blob \| history
vpx_dsp/x86/vpx_subpixel_8t_intrin_avx2.c		patch \| blob \| history
vpx_dsp/x86/vpx_subpixel_8t_intrin_ssse3.c		patch \| blob \| history